Escalares de texto entre aspas
Mantenha palavras como yes, datas, pontuação e frases com dois-pontos como valores de cadeia. O texto extraído não vira instruções YAML nem tags de objetos personalizados.
Exporte itens de texto de PDF e suas posições na página como dados YAML.
Arraste seus arquivos para cá ou use o botão abaixo.
Até 25 MB no total · Os arquivos permanecem no seu dispositivo
Confira a prévia do documento aqui. Ao adicionar conteúdo, use-a como referência para posicioná-lo e confira o arquivo salvo.
Crie um arquivo YAML contendo itens de texto extraídos de páginas PDF selecionadas. O resultado inclui referências às páginas de origem, geometria de página e transformações de posição do texto, permitindo sua inspeção em um editor de texto ou fluxo de processamento separado.
A exportação não interpreta o documento como configuração de aplicativo. Ela não deduz níveis de títulos, extrai figuras, reconhece campos de faturas nem reconstrói uma tabela por sua aparência. O texto segue a ordem de extração do leitor PDF, que pode ser diferente da ordem de leitura.
Mantenha palavras como yes, datas, pontuação e frases com dois-pontos como valores de cadeia. O texto extraído não vira instruções YAML nem tags de objetos personalizados.
As páginas selecionadas mantêm seus números de origem. Revisores podem voltar à página PDF correspondente sem contar posições na matriz de saída.
Armazene transformações e direção do texto, além das dimensões de página, junto com as palavras. Um processo posterior pode examinar a posição sem presumir que já existe uma tabela pronta.
A saída declara que reconstrução semântica e OCR não foram realizados. Isso ajuda outro programa a tratar o resultado como dados extraídos.
Escolha um PDF que contenha o texto que você precisa inspecionar.
Selecione a captura de tela para ampliá-la.
Comece com um conjunto pequeno de páginas de origem.
Selecione a captura de tela para ampliá-la.
Salve a saída e inspecione os valores de texto entre aspas.
Selecione a captura de tela para ampliá-la.
As capturas de tela mostram estas ferramentas com arquivos de exemplo sem dados sensíveis. O nome do seu arquivo, o número de páginas e as configurações podem ser diferentes.
YAML pode ser conveniente para revisões em texto quando uma equipe quer informações estruturadas de páginas sem um visualizador separado. Use a exportação como dados de documento e aplique sua própria validação antes de importar. Um extrato PDF nunca deve virar configuração confiável apenas porque suas palavras foram armazenadas em um arquivo YAML.
Inspecione o texto e as referências de página antes de criar regras de extração para um layout documental conhecido.
Mantenha um registro intermediário legível enquanto confere citações selecionadas e suas localizações nas páginas.
Compare alterações nos dados extraídos de documentos usando ferramentas que trabalham com arquivos de texto estruturado.
| Configuração | O que esperar |
|---|---|
| Arquivo de entrada | Um PDF de até 25 MiB e 500 páginas de origem. |
| Páginas selecionadas | Até 200 páginas na ordem digitada; referências repetidas aparecem uma única vez. |
| Limites de extração | 20.000 itens por página, 100.000 por tarefa e dois milhões de caracteres de texto. |
| Saída YAML | YAML 1.2 declarado, com valores de cadeia entre aspas; download máximo de 64 MiB. |
Um formulário pode conter a palavra impressa yes ao lado de um rótulo e um número com zeros à esquerda. Inspecione essas cadeias extraídas no YAML e compare-as com a origem. A exportação mantém o texto como valores entre aspas, permitindo que seu aplicativo decida se um valor é um rótulo, identificador, data ou outra informação.
| Situação | O que verificar |
|---|---|
| O texto contém sequências de escape Unicode | Um analisador YAML consegue recuperar os caracteres originais dos escapes entre aspas. Isso também impede que caracteres de controle desorganizem a estrutura do arquivo. |
| A saída não é uma configuração pronta para importar | Ela é um registro de extração. Mapeie e valide separadamente os campos necessários ao seu aplicativo. |
| A seleção é densa demais | Reduza o intervalo de páginas. Uma página densa pode atingir o limite de itens ou caracteres de texto antes do limite de páginas. |
Não. Ela lê um PDF e cria YAML de saída. Não carrega YAML enviado, executa tags nem aplica configurações.
Não é realizado OCR automático. Execute OCR primeiro em um PDF que contenha apenas imagens e confira o texto reconhecido antes de exportá-lo.
Não necessariamente. Páginas com várias colunas e rótulos posicionados podem produzir outra ordem de extração. Confira as coordenadas e a página original.