PDF para JSON

Exporte texto selecionável, geometria de página e posições de texto como JSON.

Selecione arquivos PDF

Arraste seus arquivos para cá ou use o botão abaixo.

Até 25 MB no total · Os arquivos permanecem no seu dispositivo

Índice de conteúdo10 seções

O que é possível extrair de um PDF para JSON?

Transforme a camada de texto de um PDF em um arquivo JSON para inspeção ou processamento posterior. A exportação registra as páginas selecionadas, suas dimensões e os itens de texto retornados pelo leitor de PDF, incluindo posições e transformações.

Um PDF armazena instruções para exibir uma página. Esta ferramenta não deduz campos de faturas, reconstrói tabelas nem identifica os níveis dos títulos originais. Páginas digitalizadas precisam de OCR antes que suas palavras possam aparecer na exportação.

Recursos de PDF para JSON

Seleção de páginas

Exporte um intervalo específico mantendo os números das páginas originais. Assim, fica mais fácil conferir uma amostra pequena antes de processar um documento longo.

Texto com coordenadas

Mantenha os itens de texto junto com a geometria da página e as informações de posicionamento. Use o PDF original para interpretar as coordenadas e verificar a relação visual entre os itens.

Saída legível por máquinas

Baixe JSON válido para seu próprio analisador ou fluxo de revisão. O texto exportado recebe escape como dado; a ferramenta não executa o conteúdo do documento.

Processamento local

Leia o PDF selecionado no navegador. O documento não é enviado a um servidor de conversão e o arquivo original não é alterado.

Como converter o texto de um PDF para JSON?

  1. Escolha um PDF não criptografado cujo texto possa ser selecionado em um leitor.
  2. Digite números de páginas, como 1, 3-5, ou deixe Páginas em branco para incluir todas as páginas permitidas.
  3. Inicie a conversão e baixe o arquivo JSON.
  4. Abra-o em um visualizador ou editor de JSON e compare uma frase conhecida com a página correspondente do PDF.
  5. Confira as coordenadas, a ordem de leitura e eventuais páginas vazias antes de usar os dados em outro aplicativo.

Selecione o PDF

Escolha um PDF que contenha texto selecionável.

Selecione a captura de tela para ampliá-la.
PDF para JSON: seleção de um PDF de exemplo com uma camada de texto.

Escolha as páginas

Defina o intervalo de páginas e confira os limites de extração.

Selecione a captura de tela para ampliá-la.
PDF para JSON: seleção de páginas e configurações de extração.

Baixe o JSON

Salve o JSON e compare-o com a página de origem.

Selecione a captura de tela para ampliá-la.
PDF para JSON: download da exportação de texto estruturado concluída.

As capturas de tela mostram estas ferramentas com arquivos de exemplo sem dados sensíveis. O nome do seu arquivo, o número de páginas e as configurações podem ser diferentes.

Por que exportar texto de PDF como JSON?

JSON é útil quando um fluxo de documentos precisa tanto do texto quanto de sua posição. Um desenvolvedor pode inspecionar a qualidade da extração, localizar rótulos repetidos ou preparar um mapeamento separado. Esse mapeamento deve ser explícito: um valor próximo não é automaticamente o total de uma fatura, e a ordem de extração não necessariamente corresponde à ordem de leitura de uma pessoa.

Quem pode usar esta exportação?

Desenvolvedores de documentos

Inspecione a camada de texto antes de criar um analisador e mantenha referências de página para depuração.

Equipes de revisão de dados

Compare valores de amostra com a página de origem antes de aceitar uma regra de extração.

Estudantes e pesquisadores

Explore como o texto visível é representado em um documento de layout fixo.

Configurações e verificações do resultado

ConfiguraçãoO que esperar
EntradaUm PDF de até 25 MiB, com até 500 páginas de origem.
SeleçãoAté 200 páginas selecionadas; até 20.000 itens de texto por página, 100.000 por tarefa e dois milhões de caracteres de texto.
SaídaJSON contendo texto extraído e geometria; máximo de 64 MiB.
Páginas digitalizadasSem OCR automático, exportação de imagens ou reconhecimento de campos do documento.

Confira uma amostra pequena antes de criar um analisador

Para um extrato com duas colunas, exporte primeiro uma página. Localize um rótulo conhecido e compare sua posição com o valor impresso. Se itens das duas colunas estiverem intercalados, agrupe-os por coordenadas no seu código, em vez de presumir que a matriz já é uma tabela pronta.

Solução de problemas de PDF para JSON

SituaçãoO que verificar
Nenhum texto selecionável é encontradoExecute OCR nas páginas digitalizadas e exporte a camada de texto do PDF resultante.
O texto aparece em uma ordem inesperadaCompare a página e as posições do texto; a ordem de extração não determina a ordem de leitura.
Uma seleção grande é rejeitadaEscolha menos páginas. Páginas densas podem atingir o limite de itens de texto antes do limite de páginas.

Perguntas frequentes

PDF para JSON reconhece campos de faturas?

Não. O resultado contém itens de texto e geometria. Nomes de campos, relações e validação de negócio exigem um processo de mapeamento separado.

Imagens e tabelas são incluídas?

Imagens não são exportadas. O texto de uma tabela pode ser extraído, mas as relações entre linhas e colunas não são reconstruídas.

Posso recriar o PDF original a partir deste JSON?

A exportação é um formato de inspeção, não uma representação completa do PDF. Mantenha o PDF original para preservar aparência, gráficos, fontes e recursos interativos.

Ferramentas relacionadas

JSON para PDF, PDF para XML, OCR de PDF.