PDFをHTMLに変換

PDFのテキストレイヤーから簡易的なHTML文書を作成します。

PDF ファイルを選択

ここにファイルをドロップするか、下のボタンで選択してください。

最大 100 MB 合計 · ファイルは端末内に保持

目次セクション: 11

PDF の文字を HTML に書き出すと何が含まれますか?

選択可能な PDF の文字を、選択したページごとにセクションを持つ簡単な HTML 文書へ書き出します。読みやすい文章の参考資料や、ウェブ編集の出発点に役立ちます。

抽出した文字はエスケープされ、対話的な PDF の内容や元の CSS は再現しません。出力は文章による表現であり、PDF とピクセル単位で一致するウェブサイト版ではありません。

PDF から HTML への変換機能

元のページごとに 1 セクション

HTML には選択した元のページを示すラベルが付くため、読者は対応する PDF ページに戻れます。

文字内容のエスケープ

抽出した文字は HTML 用にエスケープされます。PDF の文字を埋め込み HTML コードとして実行することはありません。

ページを選んで書き出す

作業に関連するページだけを選び、小さな参考文書を作成します。

ブラウザーで読める簡単なファイル

ダウンロードは HTML のテキスト文書として開きます。元のフォント、画像、ページの CSS は再現しません。

PDF の HTML テキスト版を作るのはなぜですか?

HTML にすると、抽出した文章をブラウザーで見たり、ウェブ編集者へ渡したりしやすくなります。この変換ツールはページ番号付きの文章セクションを作成し、公開担当者が適切なウェブページを作る際の参考に役立ちます。意味に基づく見出しの推定、表の再構築、完成されたアクセシブルな出版物の提供は行いません。変換後は、内容を意味のある見出しと段落に整理し直し、読み順を確認して、使用が許可された画像を別途追加してください。見た目を固定したプレビューが必要な場合は、代わりにページの描画を使用します。

PDF から HTML へのテキスト書き出しは誰が使いますか?

ウェブコンテンツの編集者

承認されたパンフレットの文章を取り出し、ウェブページの下書きにします。汎用的なページセクションを意味のある見出しに置き換え、改行が文を分断していないことを確認してください。

社内ナレッジベースの保守担当者

文章中心の PDF 手順書から、ブラウザーで読める参考資料を作成します。チームのシステム向けに確認済みの記事を準備する間は、元のページへの参照を保持してください。

デジタル出版を学ぶ学生

固定された PDF のレイアウトを、簡単な HTML の文章表現と比較します。使いやすいウェブ版にするために、どの構造、画像の説明、表のマークアップを手作業で補う必要があるか特定してください。

PDF の文字を HTML に変換するにはどうすればよいですか?

  1. 選択可能な文字を含む、暗号化されていない PDF を選びます。ページが画像だけの場合は、先に OCR を使用してください。
  2. HTML の参考資料に含めるページを選び、必要ならダウンロード名を設定します。
  3. 変換して HTML ファイルをダウンロードし、ブラウザーで開きます。
  4. ページのセクションと文字の順序を確認します。文章を完成したページとして公開する前に、ウェブエディターで意味に沿った構造を整えてください。

元ファイルを選択

HTMLに文字を抽出するため、テキスト主体のPDFを選びます。

スクリーンショットを選択すると拡大できます。
PDFをHTMLに変換、手順1:HTMLに文字を抽出するため、テキスト主体のPDFを選びます。

ツールの設定を確認

元のページを設定し、必要に応じてダウンロード名を指定します。

スクリーンショットを選択すると拡大できます。
PDFをHTMLに変換、手順2:元のページを設定し、必要に応じてダウンロード名を指定します。

結果をダウンロードして確認

HTMLをダウンロードし、ページ表示付きのテキスト部分を確認します。

スクリーンショットを選択すると拡大できます。
PDFをHTMLに変換、手順3:HTMLをダウンロードし、ページ表示付きのテキスト部分を確認します。

スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。

設定と出力の確認

設定想定される動作
対応する入力PDF
処理場所お使いのブラウザー
ファイル選択入力ファイル 1 個
入力サイズ合計 100 MB。展開した画像とページにはピクセル数の上限もあります
ページの選択1 回の処理で最大 200 ページを選択できます。「ページ」の空欄が全ページを意味するのは、PDF が 200 ページ以下の場合だけです。より長い文書には範囲を分けて使用してください。

この書き出しには既存のテキスト層が必要です。スキャンしたページの文章を生成 HTML に含めるには、先に OCR を行って確認する必要があります。

ページの区切りを有用なウェブ構造に変える

印刷ページの境界が、そのまま完全なウェブのセクションを示すことはまれです。書き出し結果を編集する際は、内容を説明する見出しの下に段落を置き、実際の表には適切な行と列のマークアップを与え、重要な図には説明文を付けてください。生成された整形済みテキストは編集用の参考であり、元の文書が完成したウェブページになった証明ではありません。元のページラベルを削除する前に、文章を PDF と照合します。

PDF から HTML への変換で問題が起きた場合

状況対処方法
ページのデザインがないこれは PDF の文字を HTML に書き出す機能であり、見た目のレイアウトを再構築するものではありません。
スキャンしたページの内容がない先に OCR テキスト層を追加し、確認してください。
文字が HTML コードのように見える抽出した文書内容が実行されないよう、意図的にエスケープしています。

実用例と最終確認

「プロジェクト計画」のような印刷上のタイトルが、書き出された pre 内の文字になることがあります。文書のタイトルだと確認できたら、<h1>プロジェクト計画</h1> とし、続く本文を p 要素にできます。PDF のページ末尾だけでなく、文章の意味に基づいて構造を選んでください。

よくある質問

PDF のリンクや画像は保持されますか?

この書き出しには、エスケープされた抽出文字が含まれます。画像、有効なリンク、元のページスタイルは再構築しません。

HTML を完成したウェブページとしてアップロードできますか?

まず内容、アクセシビリティ、書式を確認してください。抽出文字を完成したサイトとして扱わず、適切なウェブレイアウトを追加します。

書き出した HTML を編集できますか?

はい。ダウンロードしたファイルをテキストエディターまたは HTML エディターで開きます。公開ページで使用する前に、抽出された文字を確認し、適切な構造を追加してください。

関連ツールとガイド

次のツールもご利用ください:HTMLをPDFに変換, PDFをOCR処理, PDFをテキストに変換.