Uma seção por página de origem
O HTML identifica as páginas de origem selecionadas para que o leitor possa voltar à página correspondente do PDF.
Crie um documento HTML simples a partir da camada de texto do PDF.
Arraste seus arquivos para cá ou use o botão abaixo.
Até 100 MB no total · Os arquivos permanecem no seu dispositivo
Confira a prévia do documento aqui. Ao adicionar conteúdo, use-a como referência para posicioná-lo e confira o arquivo salvo.
Exporte texto selecionável de PDF para um documento HTML simples com uma seção para cada página selecionada. O resultado é útil como referência de texto legível ou como ponto de partida para edição na web.
A ferramenta aplica escape aos caracteres extraídos e não recria conteúdo interativo do PDF nem o CSS original. O resultado é uma representação textual, não uma versão do PDF para site com correspondência exata de pixels.
O HTML identifica as páginas de origem selecionadas para que o leitor possa voltar à página correspondente do PDF.
Os caracteres extraídos recebem escape para HTML. O texto do PDF não é executado como código HTML incorporado.
Crie um documento de referência menor escolhendo apenas as páginas relevantes para a tarefa.
O download abre como um documento de texto HTML. Ele não reproduz as fontes, as imagens nem o CSS das páginas de origem.
HTML pode facilitar a visualização da redação extraída em um navegador ou sua entrega a um editor da web. Este conversor cria seções de texto identificadas por página, úteis como referência enquanto um editor prepara uma página da web adequada. Ele não infere títulos semânticos, não recria tabelas nem fornece uma publicação acessível completa. Depois da conversão, reestruture o conteúdo em títulos e parágrafos significativos, verifique a ordem de leitura e adicione separadamente quaisquer imagens autorizadas. Use a renderização de páginas quando a necessidade for uma visualização fixa.
Recupere a redação aprovada de um folheto para um rascunho de página da web. Substitua as seções genéricas de página por títulos significativos e verifique se as quebras de linha não dividiram frases.
Crie uma referência legível pelo navegador a partir de um procedimento em PDF centrado em texto. Preserve as referências de página da origem enquanto prepara um artigo revisado para o sistema da equipe.
Compare o layout fixo do PDF com uma representação simples de texto HTML. Identifique quais estruturas, descrições de imagem e marcações de tabela precisam ser fornecidas manualmente para uma edição utilizável na web.
Escolha um PDF baseado em texto para extração em HTML.
Selecione a captura de tela para ampliá-la.
Defina as páginas de origem e um nome opcional para o download.
Selecione a captura de tela para ampliá-la.
Baixe o HTML e confira suas seções de texto identificadas por página.
Selecione a captura de tela para ampliá-la.
As capturas de tela mostram estas ferramentas com arquivos de exemplo sem dados sensíveis. O nome do seu arquivo, o número de páginas e as configurações podem ser diferentes.
| Configuração | O que esperar |
|---|---|
| Formato de entrada aceito | |
| Local de processamento | Seu navegador |
| Seleção de arquivos | Um arquivo de entrada |
| Tamanho de entrada | 100 MB no total; imagens e páginas decodificadas também têm limites de pixels |
| Seleção de páginas | Até 200 páginas selecionadas por tarefa. Deixar o campo Páginas em branco significa todas as páginas apenas quando o PDF tem 200 páginas ou menos; use intervalos separados para um documento mais longo. |
Essa exportação precisa de uma camada de texto existente. Páginas digitalizadas exigem OCR conferido antes que sua redação possa aparecer no HTML gerado.
Um limite de página impressa raramente identifica uma seção completa da web. Ao editar a exportação, coloque os parágrafos sob títulos que descrevam seu assunto, dê a uma tabela real sua marcação adequada de linhas e colunas e forneça texto explicativo para diagramas importantes. O texto pré-formatado gerado é uma referência para edição, não uma prova de que o documento original agora é uma página da web concluída. Confira a redação com o PDF antes de remover os rótulos de página da origem.
| Situação | O que fazer |
|---|---|
| O design da página está ausente | Esta é uma exportação de texto de PDF para HTML, não uma reconstrução do layout visual. |
| Uma página digitalizada não tem conteúdo | Adicione e verifique uma camada de texto OCR primeiro. |
| Os caracteres parecem código HTML | Eles recebem escape deliberadamente para que o conteúdo extraído do documento não seja executado. |
Um título impresso como “Plano do projeto” pode aparecer dentro do texto pre exportado. Após confirmar que é o título do documento, um editor pode marcá-lo como <h1>Plano do projeto</h1> e colocar o texto seguinte em elementos p. Escolha a estrutura pelo significado do texto, não apenas pelo fim da página PDF.
Essa exportação inclui texto extraído com escape. Imagens, links ativos e os estilos originais das páginas não são reconstruídos.
Revise primeiro seu conteúdo, sua acessibilidade e sua formatação. Adicione um layout adequado para a web em vez de tratar o texto extraído como um site completo.
Sim. Abra o arquivo baixado em um editor de texto ou HTML. Revise os caracteres extraídos e adicione uma estrutura adequada antes de usá-lo em uma página publicada.
Continue com HTML para PDF, Reconhecer texto em PDF (OCR), PDF para Texto.