OCR de PDF

Haz que los escaneos sean buscables y conserva el aspecto original de las páginas.

Selecciona archivos PDF

Arrastra aquí tus archivos o usa el botón de abajo.

Hasta 100 MB en total · Los archivos permanecen en tu dispositivo

Índice de contenido12 secciones

¿Cuándo necesita un PDF reconocimiento OCR?

Añade una capa de texto buscable a un PDF escaneado con Tesseract ejecutándose en tu navegador. Elige el idioma del original; el español está seleccionado por defecto. Los lectores compatibles podrán buscar y seleccionar las palabras reconocidas mientras la página escaneada conserva su aspecto original.

Por defecto, la operación conserva las páginas que ya contienen texto. También puedes reconocer todas las páginas seleccionadas; esto añade una capa nueva y puede duplicar el texto existente. La precisión del OCR depende del enfoque, el contraste, el idioma y la alineación de la página. La letra pequeña, la escritura manuscrita, las tipografías poco habituales y los escaneos con ruido necesitan una revisión cuidadosa, no confianza automática.

Funciones de OCR de PDF

PDF con texto buscable o TXT

Descarga el contenido reconocido como texto sin formato o añade una capa de texto sobre el aspecto conservado del escaneo en un PDF.

Hasta 20 páginas seleccionadas

La descarga contiene solo las páginas seleccionadas. Elige hasta 20 páginas; deja Páginas en blanco para incluir todo el documento solo si tiene 20 páginas o menos.

Controles de reconocimiento

Elige el idioma del original, 200 o 300 DPI, un giro para el reconocimiento y una distribución automática, de un solo bloque o de texto disperso. Los idiomas compatibles figuran en las preguntas frecuentes de abajo.

Conservar el texto existente por defecto

Puedes conservar las páginas que ya contienen texto. Fuerza el reconocimiento solo después de considerar la posible duplicación de capas de texto.

¿Por qué añadir una capa de texto buscable a un escaneo?

Un escaneo almacena la página como una imagen, por lo que la búsqueda de texto habitual no encuentra las palabras impresas. El OCR puede hacer buscable un escaneo mecanografiado y proporcionar texto para copiar, pegar o extraer después. Resulta especialmente útil en archivos donde encontrar un nombre o una frase conocida importa más que rediseñar la página. La capa reconocida puede contener errores aunque el escaneo parezca claro. Prueba la búsqueda y la selección; después, compara nombres, referencias y números con la imagen antes de utilizar el texto extraído.

¿Quién utiliza OCR en PDF escaneados?

Personal de bibliotecas y archivos

Haz que un documento breve mecanografiado se pueda buscar por título, nombre o número de referencia. Conserva el escaneo original y prueba esos términos en la copia descargada, incluidos los caracteres que puedan confundirse.

Estudiantes con materiales escaneados

Convierte los apuntes mecanografiados del curso en un documento buscable antes de preparar notas de estudio. Las anotaciones manuscritas pueden seguir siendo poco fiables, así que compara las citas con el escaneo.

Personal de administración de recursos humanos

Extrae el texto de una nota escaneada aprobada para un índice interno. Compara con cuidado las fechas, los nombres del personal y los números de referencia, porque un solo carácter reconocido puede cambiar un identificador.

¿Cómo haces que un PDF escaneado permita buscar texto?

  1. Elige un escaneo sin cifrar y selecciona un máximo de 20 páginas. El PDF descargado contiene solo esa selección. Empieza con una muestra breve si aún no has utilizado este tipo de escaneo.
  2. Selecciona el idioma del original en Idioma del texto. Elige PDF con texto buscable o Texto sin formato, ajusta la resolución de reconocimiento y selecciona un giro o una distribución de página si el escaneo lo requiere.
  3. Conserva el texto existente por defecto o elige deliberadamente Reconocer todas las páginas seleccionadas. Inicia OCR y espera a que termine el reconocimiento.
  4. Descarga el resultado. Busca una frase conocida, copia una línea y compara la ortografía y los números con el escaneo original.

Selecciona los archivos de origen

Elige un escaneo en un idioma compatible y selecciona hasta 20 páginas.

Selecciona la captura para ampliarla.
OCR de PDF, paso 1: Elige un escaneo en un idioma compatible y selecciona hasta 20 páginas.

Revisa los ajustes de la herramienta

Selecciona el idioma del original, la salida OCR, la resolución, la distribución y la orientación para el reconocimiento.

Selecciona la captura para ampliarla.
OCR de PDF, paso 2: Selecciona el idioma del original, la salida OCR, la resolución, la distribución y la orientación para el reconocimiento.

Descarga y comprueba el resultado

Descarga el resultado y contrasta el texto reconocido con el escaneo original.

Selecciona la captura para ampliarla.
OCR de PDF, paso 3: Descarga el resultado y contrasta el texto reconocido con el escaneo original.

Las capturas muestran estas herramientas con archivos de ejemplo sin datos sensibles. El nombre de tu archivo, el número de páginas y los ajustes pueden ser diferentes.

Una lista de comprobación en imagen ahora permite buscar texto

La página original es una imagen sin texto extraíble. OCR añade una capa de texto y conserva el aspecto visible de la página. Por eso ambas imágenes se ven iguales; el archivo descargable también contiene las palabras reconocidas.

Antes: página basada en una imagen

La extracción de texto del archivo original devolvió cero caracteres.

Lista original basada en una imagen antes de aplicar OCR, sin capa de texto seleccionable.

Después: la misma página con texto buscable

El resultado contiene las seis líneas del ejemplo. Sus píxeles renderizados coinciden con los del original en la prueba con imágenes de 1300 píxeles.

PDF resultante con texto buscable, el mismo aspecto de la lista y una nueva capa de texto.
Texto original
0 caracteres
Texto del resultado
198 caracteres
Comprobación del reconocimiento
6 de 6 líneas del ejemplo
Leer el texto extraído del resultado
LISTA DEL TALLER
Confirma la reserva del salón.
Imprime cuarenta copias del folleto.
Prueba el proyector antes de las 09:00.
Guarda la hoja final de asistencia.
Este es un ejemplo de OCR en español.

Ajustes utilizados: Página 1; PDF con texto buscable; idioma Español; reconocimiento a 200 ppp; un solo bloque de texto; orientación original.

Este ejemplo en español, limpio y con letra grande, no mide la precisión con letra pequeña, escritura manuscrita, escaneos inclinados u otros idiomas. Revisa los nombres, importes y fechas de tu propio resultado.

Comprobado el . Documentos ficticios en español, sin datos sensibles, procesados con estas herramientas en un navegador Chromium local. Estos ejemplos no son una prueba de rendimiento del alojamiento publicado.

Ajustes y comprobación del resultado

AjusteQué puedes esperar
Formato de entradaPDF
Lugar de procesamientoTu navegador, en tu dispositivo
Selección de archivosUn archivo de entrada
Tamaño de entradaHasta 100 MB, según la memoria del dispositivo y los límites de las páginas decodificadas
Lote de reconocimientoHasta 20 páginas seleccionadas; solo esas páginas aparecen en el PDF con texto buscable descargado.

La herramienta añade una capa de texto; no reconstruye tablas como hojas de cálculo editables ni corrige hechos. El OCR no sustituye la revisión de nombres, números de cuenta y otros textos que requieren precisión.

Comprueba la orientación del reconocimiento sin cambiar el escaneo

El ajuste de giro rota la imagen del escaneo que recibe el reconocimiento; el PDF con texto buscable conserva el aspecto visible de la página original. No sustituye a Girar PDF cuando quieres que el lector vea la página en posición correcta. Si una capa de texto existente contiene errores, forzar el reconocimiento puede añadir otra capa y duplicar los resultados de búsqueda. En ese caso, OCR de texto sin formato puede servir como extracción revisada. Compara con la imagen caracteres fáciles de confundir, como 0/O, 1/l y los puntos decimales.

Solución de problemas de OCR de PDF

SituaciónQué hacer
Un nombre o un número es incorrectoCompara el texto reconocido con la imagen. Corrígelo en un editor adecuado antes de reutilizarlo.
Una capa OCR existente con errores no mejoraElige Reconocer todas las páginas seleccionadas para añadir una capa nueva. El texto existente se conserva, por lo que puede producir resultados de búsqueda duplicados; exporta texto sin formato si necesitas una extracción limpia.
Se rechaza un conjunto largo de páginasDivídelo en grupos de 20 páginas o menos, aplica OCR a cada grupo y verifica los resultados antes de unirlos.

Ejemplo práctico y comprobaciones finales

En una hoja de inspección mecanografiada, busca un identificador de equipo conocido en el PDF con texto buscable; después, copia ese identificador y una medida en un editor de texto. Compáralos con el escaneo y confirma que la selección destaque la línea correcta. Encontrar una palabra no demuestra por sí solo un orden de lectura correcto ni una extracción numérica fiable.

Preguntas frecuentes

¿OCR convierte la página en contenido Word editable?

El resultado sigue siendo un PDF con una capa de texto añadida. Usa después PDF a Word si necesitas un documento de texto con distribución editable.

¿Qué idiomas están habilitados?

Esta versión incluye modelos de reconocimiento para español, inglés, portugués, alemán, indonesio, ruso, francés, italiano, turco, árabe, chino simplificado, japonés, coreano, polaco e hindi. Español es la opción predeterminada; selecciona el idioma que corresponda al texto del original. El OCR reconoce caracteres, pero no traduce el documento. Para otros idiomas, utiliza un procedimiento OCR compatible con el idioma correspondiente.

¿Por qué se ha omitido una página?

El ajuste predeterminado conserva las páginas con una capa de texto existente. Selecciona Reconocer todas las páginas seleccionadas para aplicarles también el reconocimiento.

¿El resultado incluye páginas que no seleccioné?

No. El PDF con texto buscable contiene solo las páginas seleccionadas. Para conservar un documento largo completo, reconoce lotes de hasta 20 páginas y une los resultados verificados en su orden original.

¿El giro de reconocimiento rota la página visible del PDF?

No. Rota la imagen enviada al reconocimiento y conserva el aspecto visible de la página original en el PDF. Usa primero Girar PDF si quieres que la propia página guardada aparezca en la orientación correcta.

¿Esta herramienta lee de forma fiable la escritura manuscrita o reconstruye tablas?

La herramienta reconoce texto en el idioma seleccionado; no promete reconocer de forma fiable la escritura a mano ni reconstruir celdas de tablas. Usa un escaneo mecanografiado nítido y bien orientado, y verifica el texto antes de llevarlo a Word o a una hoja de cálculo.

Herramientas y guías relacionadas

Continúa con PDF a Word, PDF a texto, Escanear a PDF. Para requisitos de conservación a largo plazo, consulta PDF a PDF/A; un PDF con texto buscable no es automáticamente PDF/A.