PDF a JSON

Exporta texto seleccionable, geometría de página y posiciones de texto a JSON.

Selecciona archivos PDF

Arrastra aquí tus archivos o usa el botón de abajo.

Hasta 25 MB en total · Los archivos permanecen en tu dispositivo

Índice de contenido10 secciones

¿Qué puedes extraer de un PDF a JSON?

Convierte la capa de texto de un PDF en un archivo JSON para revisarlo o procesarlo después. La exportación registra las páginas seleccionadas, sus dimensiones y los elementos de texto que devuelve el lector de PDF, incluidas sus posiciones y transformaciones.

Un PDF almacena instrucciones para mostrar una página. Esta herramienta no deduce campos de facturas, reconstruye tablas ni identifica los niveles de los encabezados originales. Las páginas escaneadas necesitan OCR para que sus palabras puedan aparecer en la exportación.

Funciones de PDF a JSON

Selección de páginas

Exporta un intervalo concreto conservando los números de página originales. Así resulta más fácil revisar una muestra pequeña antes de procesar un documento largo.

Texto con coordenadas

Conserva los elementos de texto junto con la geometría de página y la información de posición. Usa el PDF original para interpretar las coordenadas y comprobar la relación visual entre los elementos.

Resultado legible por máquinas

Descarga JSON válido para tu propio analizador o proceso de revisión. El texto exportado se escapa como datos; la herramienta no ejecuta el contenido del documento.

Procesamiento local

Lee el PDF seleccionado en tu navegador. El documento no se envía a un servidor de conversión y el archivo original no se modifica.

¿Cómo convierto el texto de un PDF a JSON?

  1. Elige un PDF sin cifrar cuyo texto pueda seleccionarse en un lector.
  2. Introduce números de página como 1, 3-5, o deja Páginas vacío para incluir todas las páginas permitidas.
  3. Inicia la conversión y descarga el archivo JSON.
  4. Ábrelo en un visor o editor de JSON y compara una frase conocida con la página correspondiente del PDF.
  5. Comprueba las coordenadas, el orden de lectura y las páginas vacías antes de usar los datos en otra aplicación.

Selecciona el PDF

Elige un PDF que contenga texto seleccionable.

Selecciona la captura para ampliarla.
PDF a JSON: selección de un PDF de ejemplo con una capa de texto.

Elige las páginas

Configura el intervalo de páginas y revisa los límites de extracción.

Selecciona la captura para ampliarla.
PDF a JSON: selección de páginas y ajustes de extracción.

Descarga el JSON

Guarda el JSON y compáralo con la página de origen.

Selecciona la captura para ampliarla.
PDF a JSON: descarga de la exportación de texto estructurado terminada.

Las capturas muestran estas herramientas con archivos de ejemplo sin datos sensibles. El nombre de tu archivo, el número de páginas y los ajustes pueden ser diferentes.

¿Por qué exportar texto de un PDF a JSON?

JSON resulta útil cuando un proceso documental necesita tanto el texto como su posición. Un desarrollador puede revisar la calidad de la extracción, localizar etiquetas repetidas o preparar una asignación de campos independiente. Esa asignación debe ser explícita: un importe cercano no es automáticamente el total de una factura, y el orden de extracción no tiene por qué coincidir con el orden de lectura de una persona.

¿Quién puede usar esta exportación?

Desarrolladores de procesos documentales

Revisa la capa de texto antes de crear un analizador y conserva las referencias de página para depurar errores.

Equipos de revisión de datos

Compara valores de muestra con la página de origen antes de aceptar una regla de extracción.

Estudiantes e investigadores

Explora cómo se representa el texto visible en un documento de diseño fijo.

Ajustes y comprobaciones del resultado

AjusteQué esperar
EntradaUn PDF de hasta 25 MiB y hasta 500 páginas de origen.
SelecciónHasta 200 páginas seleccionadas; hasta 20.000 elementos de texto por página, 100.000 por tarea y dos millones de caracteres de texto.
ResultadoJSON con texto extraído y geometría; máximo de 64 MiB.
Páginas escaneadasSin OCR automático, exportación de imágenes ni reconocimiento de campos del documento.

Revisa una muestra pequeña antes de crear un analizador

Para un extracto con dos columnas, exporta primero una página. Localiza una etiqueta conocida y compara su posición con el valor impreso. Si los elementos de ambas columnas aparecen intercalados, agrúpalos mediante las coordenadas en tu propio código, en lugar de dar por hecho que la matriz ya es una tabla terminada.

Solución de problemas de PDF a JSON

SituaciónQué comprobar
No se encuentra texto seleccionableAplica OCR a las páginas escaneadas y después exporta la capa de texto del PDF resultante.
El texto aparece en un orden inesperadoCompara la página y las posiciones del texto; el orden de extracción no establece el orden de lectura.
Se rechaza una selección grandeElige menos páginas. Las páginas densas pueden alcanzar el límite de elementos de texto antes que el límite de páginas.

Preguntas frecuentes

¿PDF a JSON reconoce campos de facturas?

No. El resultado contiene elementos de texto y geometría. Los nombres de campo, las relaciones y la validación de negocio requieren un proceso de asignación independiente.

¿Se incluyen imágenes y tablas?

Las imágenes no se exportan. Es posible extraer el texto de una tabla, pero no se reconstruyen las relaciones entre filas y columnas.

¿Puedo recrear el PDF original a partir de este JSON?

La exportación es un formato de inspección, no una representación completa del PDF. Conserva el PDF original para mantener la apariencia, los gráficos, las fuentes y las funciones interactivas.

Herramientas relacionadas

JSON a PDF, PDF a XML, OCR de PDF.