Reconhecer texto em PDF (OCR)

Torne digitalizações pesquisáveis, mantendo a aparência original das páginas.

Selecione arquivos PDF

Arraste seus arquivos para cá ou use o botão abaixo.

Até 100 MB no total · Os arquivos permanecem no seu dispositivo

Índice de conteúdo12 seções

Quando um PDF precisa de OCR?

Adicione uma camada de texto pesquisável a um PDF digitalizado com o Tesseract executado no navegador. Escolha o idioma do original; português do Brasil é o padrão. Leitores compatíveis poderão pesquisar e selecionar palavras reconhecidas enquanto a página digitalizada mantém sua aparência original.

Por padrão, a operação mantém as páginas que já contêm texto. Você também pode reconhecer todas as páginas selecionadas; isso adiciona uma nova camada e pode duplicar qualquer texto existente. A precisão do OCR depende de foco, contraste, idioma e alinhamento das páginas. Letras pequenas, escrita à mão, fontes incomuns e digitalizações com ruído precisam de revisão cuidadosa, não de confiança automática.

Recursos de Reconhecer texto em PDF (OCR)

PDF pesquisável ou TXT

Baixe a redação reconhecida como texto simples ou adicione uma camada de texto sobre a aparência preservada da digitalização em um PDF.

Até 20 páginas selecionadas

O download contém apenas as páginas selecionadas. Escolha até 20 páginas; deixe Páginas em branco para incluir o documento inteiro apenas quando ele tiver 20 páginas ou menos.

Controles de reconhecimento

Escolha o idioma do original, 200 ou 300 DPI, uma rotação para reconhecimento e um layout automático, de bloco único ou de texto esparso. Os idiomas compatíveis estão listados nas perguntas frequentes abaixo.

Mantenha o texto existente por padrão

Páginas que já contêm texto podem ser mantidas. Force o reconhecimento apenas depois de considerar a possibilidade de camadas de texto duplicadas.

Por que adicionar uma camada de texto pesquisável a uma digitalização?

Uma digitalização armazena a página como uma imagem; por isso, a pesquisa de texto comum não consegue encontrar as palavras impressas nela. O OCR no idioma selecionado pode tornar pesquisável uma digitalização de texto digitado e fornecer a redação para copiar e colar ou para extração posterior de texto. Ele é especialmente útil para arquivos em que encontrar um nome ou uma frase conhecida é mais importante que redesenhar a página. A camada reconhecida pode conter erros mesmo quando a digitalização parece clara. Teste a pesquisa e a seleção e depois compare nomes, referências e números com a imagem da página antes de usar a redação extraída.

Quem usa OCR em digitalizações de PDF?

Equipes de bibliotecas e documentação

Torne um documento curto digitado pesquisável por título, nome ou número de referência. Guarde a digitalização original e teste esses termos na cópia baixada, incluindo caracteres que possam ser confundidos.

Estudantes com materiais digitalizados

Torne pesquisáveis as notas de curso digitadas antes de criar anotações de estudo. Anotações manuscritas podem continuar pouco confiáveis; por isso, confira trechos citados com a digitalização.

Administradores de rotinas de pessoal

Extraia a redação de um memorando digitalizado aprovado para um índice interno. Compare datas, nomes de funcionários e números de referência com cuidado, pois um único caractere reconhecido pode mudar um identificador.

Como tornar pesquisável um PDF digitalizado?

  1. Escolha uma digitalização sem criptografia e selecione no máximo 20 páginas. O PDF baixado contém apenas essa seleção. Comece com uma amostra curta se ainda não tiver usado esse tipo de digitalização.
  2. Selecione o idioma do documento original em Idioma do texto. Escolha PDF pesquisável ou Texto simples, defina a resolução de reconhecimento e selecione uma rotação ou um layout de página se a digitalização precisar.
  3. Mantenha o texto existente por padrão ou escolha deliberadamente Reconhecer todas as páginas selecionadas. Inicie o OCR e aguarde a conclusão do reconhecimento.
  4. Baixe o resultado. Pesquise uma frase conhecida, copie uma linha e compare a grafia e os números com a digitalização original.

Escolha o arquivo de origem

Escolha uma digitalização em um idioma compatível e selecione até 20 páginas.

Selecione a captura de tela para ampliá-la.
Reconhecer texto em PDF (OCR), etapa 1: Escolha uma digitalização em um idioma compatível e selecione até 20 páginas.

Revise as configurações da ferramenta

Escolha o idioma de origem, a saída de OCR, a resolução, o layout e a orientação de reconhecimento.

Selecione a captura de tela para ampliá-la.
Reconhecer texto em PDF (OCR), etapa 2: Escolha o idioma de origem, a saída de OCR, a resolução, o layout e a orientação de reconhecimento.

Baixe e confira o resultado

Baixe e teste o texto reconhecido comparando-o com a digitalização original.

Selecione a captura de tela para ampliá-la.
Reconhecer texto em PDF (OCR), etapa 3: Baixe e teste o texto reconhecido comparando-o com a digitalização original.

As capturas de tela mostram estas ferramentas com arquivos de exemplo sem dados sensíveis. O nome do seu arquivo, o número de páginas e as configurações podem ser diferentes.

Uma lista de verificação composta apenas por imagem se torna pesquisável

A página de origem é uma imagem sem texto extraível. O OCR adiciona uma camada de texto mantendo a aparência visível da página. Por isso, as duas imagens parecem iguais; o resultado disponível para baixar também contém as palavras reconhecidas.

Antes: página composta apenas por imagem

A extração de texto da origem retornou zero caracteres.

Lista de verificação real composta apenas por imagem antes do OCR, sem camada de texto selecionável.

Depois: mesma página, texto pesquisável

O resultado contém todas as seis linhas do exemplo. Seus pixels renderizados correspondem à origem no tamanho de imagem testado de 1.300 pixels.

PDF de resultado pesquisável real com a mesma lista de verificação visível e uma nova camada de texto.
Texto da origem
0 caracteres
Texto do resultado
192 caracteres
Verificação de reconhecimento
6 de 6 linhas do exemplo (espaços normalizados)
Ler o texto extraído do resultado
LISTA DA OFICINA 
Confirme a reserva da sala. 
Imprima quarenta cópias do material. 
Teste o projetor antes das 09:00. 
Salve a 
lista final de presença. 
Este é um exemplo inofensivo de OCR.

Configurações utilizadas: Página 1; PDF com texto pesquisável; idioma Português (Brasil); reconhecimento a 200 DPI; um único bloco de texto; orientação original.

Este exemplo nítido em português e com letras grandes não é uma avaliação de precisão para letras pequenas, escrita à mão, digitalizações inclinadas ou outros idiomas. Revise nomes, valores e datas no seu próprio resultado.

Verificado em . Arquivos de exemplo sem dados sensíveis processados na interface em português brasileiro do tema 3.7.0, em um navegador Chromium local. Estes exemplos não são uma avaliação da hospedagem em produção.

Configurações e verificações do resultado

ConfiguraçãoO que esperar
Formato de entrada aceitoPDF
Local de processamentoSeu navegador, no seu dispositivo
Seleção de arquivosUm arquivo de entrada
Tamanho de entradaAté 100 MB, sujeito à memória do dispositivo e aos limites de páginas decodificadas
Lote de reconhecimentoAté 20 páginas selecionadas; apenas essas páginas aparecem no download do PDF pesquisável.

A ferramenta adiciona uma camada de texto; ela não reconstrói tabelas como uma planilha editável nem corrige o conteúdo factual. O OCR não substitui a revisão de nomes, números de conta e outros textos que exigem precisão.

Confira a orientação do reconhecimento sem alterar a digitalização

A configuração de rotação gira a digitalização renderizada fornecida ao reconhecimento; o PDF pesquisável mantém a aparência visível da página de origem. Ela não substitui Girar PDF quando você deseja que os leitores vejam a página na orientação correta. Se uma camada de texto existente contiver erros, forçar o reconhecimento pode adicionar outra camada e produzir resultados de pesquisa duplicados. O OCR de texto simples pode ser uma extração útil e verificada nessa situação. Compare caracteres facilmente confundidos, como 0/O, 1/l e separadores decimais, com a imagem.

Solução de problemas de Reconhecer texto em PDF (OCR)

SituaçãoO que fazer
Um nome ou número está erradoCompare o texto reconhecido com a imagem. Corrija-o em um editor adequado na etapa seguinte antes de reutilizá-lo.
Uma camada de OCR ruim existente não melhorouEscolha Reconhecer todas as páginas selecionadas para adicionar uma nova camada. O texto existente é mantido, então uma camada existente pode produzir resultados de pesquisa duplicados; exporte texto simples se precisar de uma extração limpa.
Um conjunto longo é rejeitadoDivida-o em grupos de 20 páginas ou menos, aplique OCR a cada grupo e verifique os resultados antes de juntar.

Um exemplo prático e verificações finais

Para uma ficha de inspeção digitada, pesquise um identificador conhecido de equipamento no PDF pesquisável e depois copie esse identificador e uma medição para um editor de texto. Compare ambos com a digitalização e confirme que a seleção destaca a linha pretendida. Uma pesquisa de palavra bem-sucedida, por si só, não estabelece uma ordem de leitura correta nem uma extração numérica confiável.

Perguntas frequentes

O OCR transforma a página em conteúdo editável do Word?

A saída continua sendo um PDF com uma camada de texto adicionada. Use PDF para Word depois se precisar de um documento de texto com fluxo reorganizado.

Quais idiomas estão disponíveis?

Esta versão inclui modelos locais de português, espanhol, inglês, alemão, indonésio, russo, francês, italiano, turco, árabe, chinês simplificado, japonês, coreano, polonês e hindi. Português do Brasil é a opção padrão; selecione o idioma correspondente ao documento antes de reconhecer. Documentos em outros idiomas precisam de um fluxo de OCR configurado separadamente.

Por que uma página foi ignorada?

A configuração padrão mantém páginas com uma camada de texto existente. Selecione Reconhecer todas as páginas selecionadas para executar o reconhecimento nelas também.

A saída inclui páginas que eu não selecionei?

Não. O PDF pesquisável contém apenas as páginas selecionadas. Para manter um documento longo junto, reconheça lotes de até 20 páginas e combine as saídas conferidas na ordem original.

A rotação de reconhecimento gira a página visível do PDF?

Não. Ela gira a imagem fornecida ao reconhecimento enquanto mantém a aparência visível da página de origem no PDF. Use Girar PDF primeiro quando a própria página salva precisar aparecer na orientação correta.

Esta ferramenta consegue ler escrita à mão com confiança ou reconstruir tabelas?

A ferramenta reconhece texto no idioma selecionado; não promete reconhecer manuscritos de forma confiável nem reconstruir células de tabelas. Use uma digitalização nítida de texto digitado, na posição correta, e confira as palavras antes de levá-las para o Word ou uma planilha.

Ferramentas e guias relacionados

Continue com PDF para Word, PDF para texto, Digitalizar para PDF. Para requisitos de armazenamento de longo prazo, consulte PDF para PDF/A; um PDF pesquisável não é automaticamente PDF/A.