PDF para Texto

Extraia a camada de texto existente para um arquivo de texto UTF-8.

Selecione arquivos PDF

Arraste seus arquivos para cá ou use o botão abaixo.

Até 100 MB no total · Os arquivos permanecem no seu dispositivo

Índice de conteúdo11 seções

O que você pode extrair de um PDF como texto simples?

Extraia a camada de texto existente no PDF para pesquisar, copiar ou continuar a edição. As linhas são agrupadas com base em suas posições na página. Isso é especialmente útil para relatórios predominantemente textuais e acervos de documentos.

O resultado contém texto simples, sem fontes, imagens ou o design das páginas. A ordem de leitura em páginas com várias colunas pode diferir da disposição visual. Uma página digitalizada sem camada de texto não pode ser transcrita por essa operação.

Recursos de PDF para texto

Extraia o texto existente

Leia a camada de texto selecionável do documento, em vez de reconhecer letras em imagens digitalizadas.

Escolha as páginas relevantes

Restrinja a exportação a um capítulo, uma carta ou um apêndice usando o campo Páginas.

Saída TXT portátil

Baixe um arquivo de texto simples que abre em editores de texto comuns, sem a diagramação de um processador de texto.

Agrupamento de linhas por posição

Fragmentos de texto próximos são agrupados em linhas. A ordem de leitura em várias colunas ainda precisa ser conferida com a página.

Por que converter o texto de um PDF em um arquivo de texto?

O texto simples é útil quando as palavras importam mais do que a diagramação impressa. Ele permite pesquisar em uma pasta local, copiar o texto para um editor ou preparar uma base limpa para anotações. Também evita carregar o design das páginas, repleto de imagens, para uma tarefa de texto. Uma camada de texto nem sempre é idêntica ao que a página parece dizer: ligaturas, erros ocultos de OCR e a ordem das colunas podem alterar a exportação. Confira parágrafos representativos e nomes ou números importantes antes de usar o resultado em outros trabalhos.

Quem usa texto extraído de PDF?

Pesquisadores universitários

Exporte o texto de um artigo cujo uso seja permitido para reunir citações e preparar anotações de leitura. Verifique cada citação com a página de origem e registre o número da página separadamente.

Assistentes administrativos

Leve o texto de uma carta padrão para um editor de texto para preparar uma versão revisada. Confira saudações, datas e quebras de linha antes de transferi-lo para o modelo da organização.

Redatores técnicos

Recupere o texto de especificações para uma anotação de trabalho pesquisável. Compare unidades, símbolos e etapas numeradas com o PDF, pois codificações de fonte incomuns podem alterar os caracteres extraídos.

Como extrair texto de um PDF?

  1. Escolha um PDF com texto selecionável. Se for uma digitalização composta apenas por imagens, crie primeiro uma camada de texto com OCR.
  2. Informe as páginas a extrair ou deixe Páginas em branco para incluir o documento inteiro. Adicione um nome para o download, se for útil.
  3. Execute a extração e baixe o arquivo TXT. Abra-o em um editor de texto.
  4. Compare a ordem dos parágrafos, a pontuação, os nomes e os números importantes com o PDF original antes de editar ou citar o texto.

Escolha o arquivo de origem

Selecione um PDF com uma camada de texto selecionável existente.

Selecione a captura de tela para ampliá-la.
PDF para Texto, etapa 1: Selecione um PDF com uma camada de texto selecionável existente.

Revise as configurações da ferramenta

Escolha as páginas e um nome opcional para o download.

Selecione a captura de tela para ampliá-la.
PDF para Texto, etapa 2: Escolha as páginas e um nome opcional para o download.

Baixe e confira o resultado

Baixe o arquivo TXT e verifique o texto comparando-o com o PDF.

Selecione a captura de tela para ampliá-la.
PDF para Texto, etapa 3: Baixe o arquivo TXT e verifique o texto comparando-o com o PDF.

As capturas de tela mostram estas ferramentas com arquivos de exemplo sem dados sensíveis. O nome do seu arquivo, o número de páginas e as configurações podem ser diferentes.

Configurações e verificações do resultado

ConfiguraçãoO que esperar
Entrada aceitaPDF
Local de processamentoSeu navegador
Seleção de arquivosUm arquivo de entrada
Tamanho da entrada100 MB no total; imagens e páginas decodificadas também têm limites de pixels
Seleção de páginasAté 200 páginas selecionadas por tarefa. Deixar Páginas em branco inclui todas as páginas somente quando o PDF tem 200 páginas ou menos; use intervalos separados para um documento maior.

Se não for possível selecionar palavras porque a página é uma digitalização, adicione e confira uma camada de texto OCR antes de usar a extração de texto.

Confira a ordem de leitura e os caracteres codificados

Os fragmentos de texto podem aparecer no PDF em uma ordem diferente de suas posições visíveis. Caixas laterais, notas de rodapé e disposições em duas colunas são motivos comuns para uma frase exportada ficar interrompida. A letra visível também pode depender de um mapeamento de fonte que não fornece o mesmo caractere na extração. Compare um parágrafo que atravessa uma coluna ou uma página e inspecione símbolos técnicos e ligaturas, como “fi”, antes de considerar o TXT uma reprodução confiável do texto de origem.

Solução de problemas de PDF para texto

SituaçãoO que fazer
O arquivo de texto está vazio ou a conversão é recusadaAs páginas selecionadas podem não ter uma camada de texto. Use OCR primeiro, quando disponível.
Algumas letras estão incorretasA codificação de texto ou a camada OCR do PDF pode ter defeitos. Compare nomes, números e símbolos com a página visível.
Você precisa de um documento formatado editávelUse PDF para Word como ponto de partida em DOCX; a diagramação exata ainda precisa ser revisada.

Um exemplo prático e verificações finais

Imagine duas colunas com A1, A2 à esquerda e B1, B2 à direita. O agrupamento por posição pode produzir A1 B1 seguido de A2 B2, misturando as colunas. Leia cada coluna no PDF antes de reorganizar as linhas extraídas; um texto com aparência limpa ainda pode juntar frases sem relação.

Perguntas frequentes

Posso extrair texto de um PDF digitalizado?

Execute OCR primeiro para adicionar texto reconhecido. A seleção de uma origem composta apenas por imagens retorna uma mensagem clara de ausência de texto.

A ferramenta preserva os parágrafos?

O agrupamento de linhas por posição aproxima a ordem das linhas. As quebras de parágrafo e as colunas complexas precisam de revisão editorial.

Como as páginas são separadas no texto baixado?

O texto das páginas selecionadas é unido com linhas em branco. Guarde o intervalo físico de páginas nas suas anotações se precisar de citações precisas que remetam ao PDF.

Ferramentas e guias relacionados

Continue com Reconhecer texto em PDF (OCR), Leitor de PDF. Para obter um resultado em outro idioma, leia o processo de tradução de PDF; a extração de texto em si não traduz.