PDF a texto

Extrae la capa de texto existente a un archivo de texto UTF-8.

Selecciona archivos PDF

Arrastra aquí tus archivos o usa el botón de abajo.

Hasta 100 MB en total · Los archivos permanecen en tu dispositivo

Índice de contenido11 secciones

¿Qué puedes extraer de un PDF como texto sin formato?

Extrae la capa de texto existente del PDF para buscar, copiar o seguir editando. Las líneas se agrupan según su posición en la página. Resulta especialmente útil para informes centrados en texto y archivos documentales.

El resultado contiene texto sin formato, sin fuentes, imágenes ni diseño de página. El orden de lectura en páginas con varias columnas puede diferir de la distribución visual. Esta operación no puede transcribir una página escaneada sin capa de texto.

Funciones de PDF a texto

Extraer texto existente

Lee la capa de texto seleccionable del documento, en lugar de reconocer letras en imágenes escaneadas.

Elegir las páginas necesarias

Limita la exportación a un capítulo, una carta o un anexo mediante el campo Páginas.

Archivo TXT fácil de abrir

Descarga un archivo de texto sin formato que se abre en los editores de texto habituales, sin el diseño de un procesador de textos.

Agrupar líneas por posición

Los fragmentos de texto cercanos se agrupan en líneas. Aun así, debes comprobar el orden de lectura de las columnas con la página original.

¿Por qué convertir el contenido de un PDF en un archivo de texto?

El texto sin formato resulta útil cuando las palabras importan más que el diseño impreso. Permite buscar en una carpeta local, copiar contenido en un editor o preparar una base sencilla para tomar notas. También evita incorporar un diseño con muchas imágenes a una tarea de texto. La capa de texto no siempre coincide exactamente con lo que se ve en la página: las ligaduras, los errores ocultos del OCR y el orden de las columnas pueden alterar la exportación. Comprueba párrafos representativos y nombres o cifras importantes antes de seguir trabajando con el resultado.

¿Quién utiliza el texto extraído de un PDF?

Investigadores universitarios

Exportan el texto de un artículo cuyo uso está permitido para recopilar citas y elaborar notas de lectura. Comprueban cada cita con su página de origen y anotan el número de página por separado.

Personal administrativo

Traslada el contenido de una carta modelo a un editor de texto para preparar una nueva versión. Revisa los saludos, las fechas y los saltos de línea antes de incorporarlo a la plantilla de la organización.

Redactores técnicos

Recuperan el contenido de especificaciones para crear notas de trabajo con función de búsqueda. Comparan unidades, símbolos y pasos numerados con el PDF, ya que algunas codificaciones de fuentes pueden alterar los caracteres extraídos.

¿Cómo extraes texto de un PDF?

  1. Selecciona un PDF con texto seleccionable. Si es un escaneo basado únicamente en imágenes, crea primero una capa de texto con OCR.
  2. Introduce las páginas que quieres extraer o deja Páginas en blanco para incluir todo el documento. Añade un nombre de descarga si te resulta útil.
  3. Inicia la extracción y descarga el archivo TXT. Ábrelo en un editor de texto.
  4. Compara el orden de los párrafos, la puntuación, los nombres y las cifras importantes con el PDF original antes de editar o citar el texto.

Selecciona los archivos de origen

Selecciona un PDF que ya tenga una capa de texto seleccionable.

Selecciona la captura para ampliarla.
PDF a texto, paso 1: Selecciona un PDF que ya tenga una capa de texto seleccionable.

Revisa los ajustes de la herramienta

Elige las páginas y, si lo deseas, el nombre de descarga.

Selecciona la captura para ampliarla.
PDF a texto, paso 2: Elige las páginas y, si lo deseas, el nombre de descarga.

Descarga y comprueba el resultado

Descarga el TXT y contrasta su contenido con el PDF.

Selecciona la captura para ampliarla.
PDF a texto, paso 3: Descarga el TXT y contrasta su contenido con el PDF.

Las capturas muestran estas herramientas con archivos de ejemplo sin datos sensibles. El nombre de tu archivo, el número de páginas y los ajustes pueden ser diferentes.

Ajustes y comprobación del resultado

AjusteQué puedes esperar
Formato de entradaPDF
Lugar de procesamientoTu navegador
Selección de archivosUn archivo de entrada
Tamaño de entrada100 MB en total; las imágenes y páginas decodificadas también tienen límites de píxeles
Selección de páginasHasta 200 páginas seleccionadas por tarea. Dejar Páginas en blanco incluye todas las páginas solo si el PDF tiene 200 páginas o menos; usa intervalos separados para documentos más largos.

Si no puedes seleccionar palabras porque la página es un escaneo, añade y comprueba una capa de texto OCR antes de extraer el texto.

Comprueba el orden de lectura y los caracteres codificados

Los fragmentos de texto pueden estar almacenados en el PDF en un orden distinto al de sus posiciones visibles. Los recuadros laterales, las notas al pie y los diseños de dos columnas suelen interrumpir las frases exportadas. La letra visible también puede depender de una correspondencia de fuente que no proporcione el mismo carácter durante la extracción. Compara un párrafo que cruce de columna o de página e inspecciona los símbolos técnicos y las ligaduras, como «fi», antes de considerar el TXT una transcripción fiable del original.

Solución de problemas de PDF a texto

SituaciónQué hacer
El archivo de texto está vacío o se rechaza la conversiónLas páginas seleccionadas podrían carecer de capa de texto. Usa primero OCR cuando esté disponible.
Algunas letras son incorrectasLa codificación del texto o la capa OCR del PDF puede tener errores. Compara nombres, números y símbolos con la página visible.
Necesitas un documento editable con formatoUsa PDF a Word como punto de partida en DOCX; aun así, debes revisar la precisión del diseño.

Ejemplo práctico y comprobaciones finales

Imagina dos columnas con A1, A2 a la izquierda y B1, B2 a la derecha. La agrupación por posición puede producir A1 B1 seguido de A2 B2, mezclando las columnas. Lee cada columna en el PDF antes de reorganizar las líneas extraídas; un texto de aspecto limpio puede unir frases que no guardan relación.

Preguntas frecuentes

¿Puedo extraer texto de un PDF escaneado?

Ejecuta primero OCR para añadir texto reconocido. Si seleccionas un archivo basado únicamente en imágenes, aparece un mensaje claro que indica que no hay texto.

¿La herramienta conserva los párrafos?

La agrupación de líneas por posición aproxima su orden. Los saltos de párrafo y las columnas complejas necesitan revisión editorial.

¿Cómo se separan las páginas en el archivo de texto descargado?

El texto de las páginas seleccionadas se une con líneas en blanco. Conserva el intervalo de páginas físicas en tus notas si necesitas citar con precisión el PDF de origen.

Herramientas y guías relacionadas

Continúa con OCR de PDF, Lector de PDF. Si necesitas el resultado en otro idioma, consulta el procedimiento para traducir un PDF; la extracción de texto por sí sola no traduce.