Extraia o texto existente
Leia a camada de texto selecionável do documento, em vez de reconhecer letras em imagens digitalizadas.
Extraia a camada de texto existente para um arquivo de texto UTF-8.
Arraste seus arquivos para cá ou use o botão abaixo.
Até 100 MB no total · Os arquivos permanecem no seu dispositivo
Confira a prévia do documento aqui. Ao adicionar conteúdo, use-a como referência para posicioná-lo e confira o arquivo salvo.
Extraia a camada de texto existente no PDF para pesquisar, copiar ou continuar a edição. As linhas são agrupadas com base em suas posições na página. Isso é especialmente útil para relatórios predominantemente textuais e acervos de documentos.
O resultado contém texto simples, sem fontes, imagens ou o design das páginas. A ordem de leitura em páginas com várias colunas pode diferir da disposição visual. Uma página digitalizada sem camada de texto não pode ser transcrita por essa operação.
Leia a camada de texto selecionável do documento, em vez de reconhecer letras em imagens digitalizadas.
Restrinja a exportação a um capítulo, uma carta ou um apêndice usando o campo Páginas.
Baixe um arquivo de texto simples que abre em editores de texto comuns, sem a diagramação de um processador de texto.
Fragmentos de texto próximos são agrupados em linhas. A ordem de leitura em várias colunas ainda precisa ser conferida com a página.
O texto simples é útil quando as palavras importam mais do que a diagramação impressa. Ele permite pesquisar em uma pasta local, copiar o texto para um editor ou preparar uma base limpa para anotações. Também evita carregar o design das páginas, repleto de imagens, para uma tarefa de texto. Uma camada de texto nem sempre é idêntica ao que a página parece dizer: ligaturas, erros ocultos de OCR e a ordem das colunas podem alterar a exportação. Confira parágrafos representativos e nomes ou números importantes antes de usar o resultado em outros trabalhos.
Exporte o texto de um artigo cujo uso seja permitido para reunir citações e preparar anotações de leitura. Verifique cada citação com a página de origem e registre o número da página separadamente.
Leve o texto de uma carta padrão para um editor de texto para preparar uma versão revisada. Confira saudações, datas e quebras de linha antes de transferi-lo para o modelo da organização.
Recupere o texto de especificações para uma anotação de trabalho pesquisável. Compare unidades, símbolos e etapas numeradas com o PDF, pois codificações de fonte incomuns podem alterar os caracteres extraídos.
Selecione um PDF com uma camada de texto selecionável existente.
Selecione a captura de tela para ampliá-la.
Escolha as páginas e um nome opcional para o download.
Selecione a captura de tela para ampliá-la.
Baixe o arquivo TXT e verifique o texto comparando-o com o PDF.
Selecione a captura de tela para ampliá-la.
As capturas de tela mostram estas ferramentas com arquivos de exemplo sem dados sensíveis. O nome do seu arquivo, o número de páginas e as configurações podem ser diferentes.
| Configuração | O que esperar |
|---|---|
| Entrada aceita | |
| Local de processamento | Seu navegador |
| Seleção de arquivos | Um arquivo de entrada |
| Tamanho da entrada | 100 MB no total; imagens e páginas decodificadas também têm limites de pixels |
| Seleção de páginas | Até 200 páginas selecionadas por tarefa. Deixar Páginas em branco inclui todas as páginas somente quando o PDF tem 200 páginas ou menos; use intervalos separados para um documento maior. |
Se não for possível selecionar palavras porque a página é uma digitalização, adicione e confira uma camada de texto OCR antes de usar a extração de texto.
Os fragmentos de texto podem aparecer no PDF em uma ordem diferente de suas posições visíveis. Caixas laterais, notas de rodapé e disposições em duas colunas são motivos comuns para uma frase exportada ficar interrompida. A letra visível também pode depender de um mapeamento de fonte que não fornece o mesmo caractere na extração. Compare um parágrafo que atravessa uma coluna ou uma página e inspecione símbolos técnicos e ligaturas, como “fi”, antes de considerar o TXT uma reprodução confiável do texto de origem.
| Situação | O que fazer |
|---|---|
| O arquivo de texto está vazio ou a conversão é recusada | As páginas selecionadas podem não ter uma camada de texto. Use OCR primeiro, quando disponível. |
| Algumas letras estão incorretas | A codificação de texto ou a camada OCR do PDF pode ter defeitos. Compare nomes, números e símbolos com a página visível. |
| Você precisa de um documento formatado editável | Use PDF para Word como ponto de partida em DOCX; a diagramação exata ainda precisa ser revisada. |
Imagine duas colunas com A1, A2 à esquerda e B1, B2 à direita. O agrupamento por posição pode produzir A1 B1 seguido de A2 B2, misturando as colunas. Leia cada coluna no PDF antes de reorganizar as linhas extraídas; um texto com aparência limpa ainda pode juntar frases sem relação.
Execute OCR primeiro para adicionar texto reconhecido. A seleção de uma origem composta apenas por imagens retorna uma mensagem clara de ausência de texto.
O agrupamento de linhas por posição aproxima a ordem das linhas. As quebras de parágrafo e as colunas complexas precisam de revisão editorial.
O texto das páginas selecionadas é unido com linhas em branco. Guarde o intervalo físico de páginas nas suas anotações se precisar de citações precisas que remetam ao PDF.
Continue com Reconhecer texto em PDF (OCR), Leitor de PDF. Para obter um resultado em outro idioma, leia o processo de tradução de PDF; a extração de texto em si não traduz.