Elementos organizados por página
Conserva los números de página de origen, la rotación y los límites visibles junto al texto extraído. Así mantienes una referencia útil al revisar un intervalo seleccionado.
Extrae elementos de texto y geometría de página de un PDF a una estructura XML documentada.
Arrastra aquí tus archivos o usa el botón de abajo.
Hasta 25 MB en total · Los archivos permanecen en tu dispositivo
Revisa aquí la vista previa del documento. Si añades contenido, úsala como guía para colocarlo y comprueba el archivo guardado.
Exporta la capa de texto seleccionable de un PDF como XML. El archivo agrupa los elementos de texto bajo sus números de página originales y registra la geometría de página, la dirección del texto y las transformaciones de posición. Proporciona datos estructurados para su inspección y procesamiento posterior.
El XML describe lo que ha extraído el lector de texto PDF. No es el XML original que pudo haber generado el documento y no identifica campos de facturas, reconstruye relaciones de tablas ni exporta imágenes. Las páginas que solo contienen imágenes necesitan OCR primero.
Conserva los números de página de origen, la rotación y los límites visibles junto al texto extraído. Así mantienes una referencia útil al revisar un intervalo seleccionado.
Caracteres como el signo & y los corchetes angulares permanecen como datos dentro de los elementos XML. El texto que parezca marcado no puede convertirse en contenido de página ejecutable mediante esta exportación.
Los caracteres que XML no puede representar directamente usan una codificación de cadena JSON marcada de forma explícita. El marcador permite que un programa receptor recupere esos valores con precisión.
Crea el archivo XML en tu dispositivo. El archivo de origen no se sube para convertirlo ni se reescribe.
Selecciona un PDF con una capa de texto legible.
Selecciona la captura para ampliarla.
Elige las páginas necesarias para la extracción XML.
Selecciona la captura para ampliarla.
Descarga el XML y revisa sus elementos de página.
Selecciona la captura para ampliarla.
Las capturas muestran estas herramientas con archivos de ejemplo sin datos sensibles. El nombre de tu archivo, el número de páginas y los ajustes pueden ser diferentes.
Un proceso basado en XML puede necesitar elementos explícitos de página y de texto antes de aplicar sus propias reglas de transformación. Un equipo puede revisar esos elementos, conservar referencias a las páginas de origen y crear una asignación independiente para tipos de documento conocidos. Mantén esa asignación separada de la extracción: la cercanía entre dos elementos de texto no establece por sí sola una relación de negocio.
Usa elementos de página y de texto como entrada de un proceso documental controlado.
Comprueba si el texto sigue disponible junto al PDF original conservado.
Compara valores de muestra con sus páginas de origen antes de aceptar reglas de transformación.
| Ajuste | Qué esperar |
|---|---|
| Origen | Un PDF de hasta 25 MiB, con un máximo de 500 páginas de origen. |
| Intervalo de páginas | Hasta 200 páginas seleccionadas. Un intervalo vacío incluye todas las páginas solo si no supera ese límite. |
| Límites de texto | Hasta 20.000 elementos por página, 100.000 por tarea y dos millones de caracteres de texto. |
| Descarga | Un documento XML de hasta 64 MiB. No se solicita ninguna DTD ni esquema externo. |
Para un documento de entrega, exporta una página y localiza un número de referencia conocido. Comprueba su transformación de texto y los elementos cercanos frente a la página original. Después, tu aplicación puede aplicar una regla para ese tipo de documento. Evita tratar todos los números cercanos como el mismo campo en diseños no relacionados.
| Situación | Qué comprobar |
|---|---|
| El XML no coincide con el esquema de un proveedor | La exportación usa su propia estructura de extracción. Crea una asignación independiente al esquema que espera tu sistema receptor. |
| Un elemento tiene un atributo encoding | Si encoding es json, analiza su texto como una cadena JSON para recuperar caracteres que no pueden aparecer directamente en XML. |
| Faltan palabras o aparecen en un orden inesperado | Comprueba si hay páginas escaneadas o texto colocado de forma inusual. Aplica OCR donde sea necesario y revisa las coordenadas. |
No. Un PDF generalmente no conserva el modelo de datos de origen. Esta exportación registra la capa de texto y la geometría que puede extraer el lector.
No. La herramienta no reconstruye la semántica del PDF etiquetado, los encabezados ni la estructura de tablas. Sus elementos de página y de texto describen resultados de extracción.
La herramienta XML a PDF puede imprimir código XML, pero no recrear el diseño original a partir de este archivo de extracción. Conserva el PDF original.