PDF a XML

Extrae elementos de texto y geometría de página de un PDF a una estructura XML documentada.

Selecciona archivos PDF

Arrastra aquí tus archivos o usa el botón de abajo.

Hasta 25 MB en total · Los archivos permanecen en tu dispositivo

Índice de contenido10 secciones

¿Qué contiene la exportación XML?

Exporta la capa de texto seleccionable de un PDF como XML. El archivo agrupa los elementos de texto bajo sus números de página originales y registra la geometría de página, la dirección del texto y las transformaciones de posición. Proporciona datos estructurados para su inspección y procesamiento posterior.

El XML describe lo que ha extraído el lector de texto PDF. No es el XML original que pudo haber generado el documento y no identifica campos de facturas, reconstruye relaciones de tablas ni exporta imágenes. Las páginas que solo contienen imágenes necesitan OCR primero.

Funciones de PDF a XML

Elementos organizados por página

Conserva los números de página de origen, la rotación y los límites visibles junto al texto extraído. Así mantienes una referencia útil al revisar un intervalo seleccionado.

Valores de texto escapados

Caracteres como el signo & y los corchetes angulares permanecen como datos dentro de los elementos XML. El texto que parezca marcado no puede convertirse en contenido de página ejecutable mediante esta exportación.

Cadenas excepcionales reversibles

Los caracteres que XML no puede representar directamente usan una codificación de cadena JSON marcada de forma explícita. El marcador permite que un programa receptor recupere esos valores con precisión.

Procesamiento en el navegador

Crea el archivo XML en tu dispositivo. El archivo de origen no se sube para convertirlo ni se reescribe.

¿Cómo extraigo XML de un PDF?

  1. Selecciona un PDF sin cifrar que contenga texto seleccionable.
  2. Introduce los números o intervalos necesarios en Páginas.
  3. Convierte el archivo y descarga el resultado XML.
  4. Abre el XML en un editor de texto o una aplicación compatible con XML.
  5. Compara una página y una frase conocidas antes de asignar los elementos a otro sistema.

Elige el PDF de origen

Selecciona un PDF con una capa de texto legible.

Selecciona la captura para ampliarla.
PDF a XML: selección de un PDF de origen.

Limita el intervalo de páginas

Elige las páginas necesarias para la extracción XML.

Selecciona la captura para ampliarla.
PDF a XML: intervalo de páginas y límites de extracción.

Guarda el XML

Descarga el XML y revisa sus elementos de página.

Selecciona la captura para ampliarla.
PDF a XML: descarga de la exportación XML terminada.

Las capturas muestran estas herramientas con archivos de ejemplo sin datos sensibles. El nombre de tu archivo, el número de páginas y los ajustes pueden ser diferentes.

¿Por qué usar XML para revisar texto de un PDF?

Un proceso basado en XML puede necesitar elementos explícitos de página y de texto antes de aplicar sus propias reglas de transformación. Un equipo puede revisar esos elementos, conservar referencias a las páginas de origen y crear una asignación independiente para tipos de documento conocidos. Mantén esa asignación separada de la extracción: la cercanía entre dos elementos de texto no establece por sí sola una relación de negocio.

¿Quién puede trabajar con este resultado XML?

Desarrolladores de integraciones

Usa elementos de página y de texto como entrada de un proceso documental controlado.

Archiveros documentales

Comprueba si el texto sigue disponible junto al PDF original conservado.

Auditores de datos

Compara valores de muestra con sus páginas de origen antes de aceptar reglas de transformación.

Ajustes y comprobaciones del resultado

AjusteQué esperar
OrigenUn PDF de hasta 25 MiB, con un máximo de 500 páginas de origen.
Intervalo de páginasHasta 200 páginas seleccionadas. Un intervalo vacío incluye todas las páginas solo si no supera ese límite.
Límites de textoHasta 20.000 elementos por página, 100.000 por tarea y dos millones de caracteres de texto.
DescargaUn documento XML de hasta 64 MiB. No se solicita ninguna DTD ni esquema externo.

Asigna una etiqueta conocida después de comprobar la página

Para un documento de entrega, exporta una página y localiza un número de referencia conocido. Comprueba su transformación de texto y los elementos cercanos frente a la página original. Después, tu aplicación puede aplicar una regla para ese tipo de documento. Evita tratar todos los números cercanos como el mismo campo en diseños no relacionados.

Solución de problemas de PDF a XML

SituaciónQué comprobar
El XML no coincide con el esquema de un proveedorLa exportación usa su propia estructura de extracción. Crea una asignación independiente al esquema que espera tu sistema receptor.
Un elemento tiene un atributo encodingSi encoding es json, analiza su texto como una cadena JSON para recuperar caracteres que no pueden aparecer directamente en XML.
Faltan palabras o aparecen en un orden inesperadoComprueba si hay páginas escaneadas o texto colocado de forma inusual. Aplica OCR donde sea necesario y revisa las coordenadas.

Preguntas frecuentes

¿PDF a XML restaura el XML de origen original?

No. Un PDF generalmente no conserva el modelo de datos de origen. Esta exportación registra la capa de texto y la geometría que puede extraer el lector.

¿Las etiquetas del PDF se convierten en un modelo de documento XML?

No. La herramienta no reconstruye la semántica del PDF etiquetado, los encabezados ni la estructura de tablas. Sus elementos de página y de texto describen resultados de extracción.

¿Puedo convertir este XML de nuevo en el mismo PDF?

La herramienta XML a PDF puede imprimir código XML, pero no recrear el diseño original a partir de este archivo de extracción. Conserva el PDF original.

Herramientas relacionadas

XML a PDF, PDF a JSON, OCR de PDF.