Extraer texto existente
Lee la capa de texto seleccionable del documento, en lugar de reconocer letras en imágenes escaneadas.
Extrae la capa de texto existente a un archivo de texto UTF-8.
Arrastra aquí tus archivos o usa el botón de abajo.
Hasta 100 MB en total · Los archivos permanecen en tu dispositivo
Revisa aquí la vista previa del documento. Si añades contenido, úsala como guía para colocarlo y comprueba el archivo guardado.
Extrae la capa de texto existente del PDF para buscar, copiar o seguir editando. Las líneas se agrupan según su posición en la página. Resulta especialmente útil para informes centrados en texto y archivos documentales.
El resultado contiene texto sin formato, sin fuentes, imágenes ni diseño de página. El orden de lectura en páginas con varias columnas puede diferir de la distribución visual. Esta operación no puede transcribir una página escaneada sin capa de texto.
Lee la capa de texto seleccionable del documento, en lugar de reconocer letras en imágenes escaneadas.
Limita la exportación a un capítulo, una carta o un anexo mediante el campo Páginas.
Descarga un archivo de texto sin formato que se abre en los editores de texto habituales, sin el diseño de un procesador de textos.
Los fragmentos de texto cercanos se agrupan en líneas. Aun así, debes comprobar el orden de lectura de las columnas con la página original.
El texto sin formato resulta útil cuando las palabras importan más que el diseño impreso. Permite buscar en una carpeta local, copiar contenido en un editor o preparar una base sencilla para tomar notas. También evita incorporar un diseño con muchas imágenes a una tarea de texto. La capa de texto no siempre coincide exactamente con lo que se ve en la página: las ligaduras, los errores ocultos del OCR y el orden de las columnas pueden alterar la exportación. Comprueba párrafos representativos y nombres o cifras importantes antes de seguir trabajando con el resultado.
Exportan el texto de un artículo cuyo uso está permitido para recopilar citas y elaborar notas de lectura. Comprueban cada cita con su página de origen y anotan el número de página por separado.
Traslada el contenido de una carta modelo a un editor de texto para preparar una nueva versión. Revisa los saludos, las fechas y los saltos de línea antes de incorporarlo a la plantilla de la organización.
Recuperan el contenido de especificaciones para crear notas de trabajo con función de búsqueda. Comparan unidades, símbolos y pasos numerados con el PDF, ya que algunas codificaciones de fuentes pueden alterar los caracteres extraídos.
Selecciona un PDF que ya tenga una capa de texto seleccionable.
Selecciona la captura para ampliarla.
Elige las páginas y, si lo deseas, el nombre de descarga.
Selecciona la captura para ampliarla.
Descarga el TXT y contrasta su contenido con el PDF.
Selecciona la captura para ampliarla.
Las capturas muestran estas herramientas con archivos de ejemplo sin datos sensibles. El nombre de tu archivo, el número de páginas y los ajustes pueden ser diferentes.
| Ajuste | Qué puedes esperar |
|---|---|
| Formato de entrada | |
| Lugar de procesamiento | Tu navegador |
| Selección de archivos | Un archivo de entrada |
| Tamaño de entrada | 100 MB en total; las imágenes y páginas decodificadas también tienen límites de píxeles |
| Selección de páginas | Hasta 200 páginas seleccionadas por tarea. Dejar Páginas en blanco incluye todas las páginas solo si el PDF tiene 200 páginas o menos; usa intervalos separados para documentos más largos. |
Si no puedes seleccionar palabras porque la página es un escaneo, añade y comprueba una capa de texto OCR antes de extraer el texto.
Los fragmentos de texto pueden estar almacenados en el PDF en un orden distinto al de sus posiciones visibles. Los recuadros laterales, las notas al pie y los diseños de dos columnas suelen interrumpir las frases exportadas. La letra visible también puede depender de una correspondencia de fuente que no proporcione el mismo carácter durante la extracción. Compara un párrafo que cruce de columna o de página e inspecciona los símbolos técnicos y las ligaduras, como «fi», antes de considerar el TXT una transcripción fiable del original.
| Situación | Qué hacer |
|---|---|
| El archivo de texto está vacío o se rechaza la conversión | Las páginas seleccionadas podrían carecer de capa de texto. Usa primero OCR cuando esté disponible. |
| Algunas letras son incorrectas | La codificación del texto o la capa OCR del PDF puede tener errores. Compara nombres, números y símbolos con la página visible. |
| Necesitas un documento editable con formato | Usa PDF a Word como punto de partida en DOCX; aun así, debes revisar la precisión del diseño. |
Imagina dos columnas con A1, A2 a la izquierda y B1, B2 a la derecha. La agrupación por posición puede producir A1 B1 seguido de A2 B2, mezclando las columnas. Lee cada columna en el PDF antes de reorganizar las líneas extraídas; un texto de aspecto limpio puede unir frases que no guardan relación.
Ejecuta primero OCR para añadir texto reconocido. Si seleccionas un archivo basado únicamente en imágenes, aparece un mensaje claro que indica que no hay texto.
La agrupación de líneas por posición aproxima su orden. Los saltos de párrafo y las columnas complejas necesitan revisión editorial.
El texto de las páginas seleccionadas se une con líneas en blanco. Conserva el intervalo de páginas físicas en tus notas si necesitas citar con precisión el PDF de origen.
Continúa con OCR de PDF, Lector de PDF. Si necesitas el resultado en otro idioma, consulta el procedimiento para traducir un PDF; la extracción de texto por sí sola no traduce.