元のページごとに 1 セクション
HTML には選択した元のページを示すラベルが付くため、読者は対応する PDF ページに戻れます。
PDFのテキストレイヤーから簡易的なHTML文書を作成します。
ここにファイルをドロップするか、下のボタンで選択してください。
最大 100 MB 合計 · ファイルは端末内に保持
ここで文書をプレビューできます。追加する内容の位置は目安です。保存した出力を確認してください。
選択可能な PDF の文字を、選択したページごとにセクションを持つ簡単な HTML 文書へ書き出します。読みやすい文章の参考資料や、ウェブ編集の出発点に役立ちます。
抽出した文字はエスケープされ、対話的な PDF の内容や元の CSS は再現しません。出力は文章による表現であり、PDF とピクセル単位で一致するウェブサイト版ではありません。
HTML には選択した元のページを示すラベルが付くため、読者は対応する PDF ページに戻れます。
抽出した文字は HTML 用にエスケープされます。PDF の文字を埋め込み HTML コードとして実行することはありません。
作業に関連するページだけを選び、小さな参考文書を作成します。
ダウンロードは HTML のテキスト文書として開きます。元のフォント、画像、ページの CSS は再現しません。
HTML にすると、抽出した文章をブラウザーで見たり、ウェブ編集者へ渡したりしやすくなります。この変換ツールはページ番号付きの文章セクションを作成し、公開担当者が適切なウェブページを作る際の参考に役立ちます。意味に基づく見出しの推定、表の再構築、完成されたアクセシブルな出版物の提供は行いません。変換後は、内容を意味のある見出しと段落に整理し直し、読み順を確認して、使用が許可された画像を別途追加してください。見た目を固定したプレビューが必要な場合は、代わりにページの描画を使用します。
承認されたパンフレットの文章を取り出し、ウェブページの下書きにします。汎用的なページセクションを意味のある見出しに置き換え、改行が文を分断していないことを確認してください。
文章中心の PDF 手順書から、ブラウザーで読める参考資料を作成します。チームのシステム向けに確認済みの記事を準備する間は、元のページへの参照を保持してください。
固定された PDF のレイアウトを、簡単な HTML の文章表現と比較します。使いやすいウェブ版にするために、どの構造、画像の説明、表のマークアップを手作業で補う必要があるか特定してください。
HTMLに文字を抽出するため、テキスト主体のPDFを選びます。
スクリーンショットを選択すると拡大できます。
元のページを設定し、必要に応じてダウンロード名を指定します。
スクリーンショットを選択すると拡大できます。
HTMLをダウンロードし、ページ表示付きのテキスト部分を確認します。
スクリーンショットを選択すると拡大できます。
スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。
| 設定 | 想定される動作 |
|---|---|
| 対応する入力 | |
| 処理場所 | お使いのブラウザー |
| ファイル選択 | 入力ファイル 1 個 |
| 入力サイズ | 合計 100 MB。展開した画像とページにはピクセル数の上限もあります |
| ページの選択 | 1 回の処理で最大 200 ページを選択できます。「ページ」の空欄が全ページを意味するのは、PDF が 200 ページ以下の場合だけです。より長い文書には範囲を分けて使用してください。 |
この書き出しには既存のテキスト層が必要です。スキャンしたページの文章を生成 HTML に含めるには、先に OCR を行って確認する必要があります。
印刷ページの境界が、そのまま完全なウェブのセクションを示すことはまれです。書き出し結果を編集する際は、内容を説明する見出しの下に段落を置き、実際の表には適切な行と列のマークアップを与え、重要な図には説明文を付けてください。生成された整形済みテキストは編集用の参考であり、元の文書が完成したウェブページになった証明ではありません。元のページラベルを削除する前に、文章を PDF と照合します。
| 状況 | 対処方法 |
|---|---|
| ページのデザインがない | これは PDF の文字を HTML に書き出す機能であり、見た目のレイアウトを再構築するものではありません。 |
| スキャンしたページの内容がない | 先に OCR テキスト層を追加し、確認してください。 |
| 文字が HTML コードのように見える | 抽出した文書内容が実行されないよう、意図的にエスケープしています。 |
「プロジェクト計画」のような印刷上のタイトルが、書き出された pre 内の文字になることがあります。文書のタイトルだと確認できたら、<h1>プロジェクト計画</h1> とし、続く本文を p 要素にできます。PDF のページ末尾だけでなく、文章の意味に基づいて構造を選んでください。
この書き出しには、エスケープされた抽出文字が含まれます。画像、有効なリンク、元のページスタイルは再構築しません。
まず内容、アクセシビリティ、書式を確認してください。抽出文字を完成したサイトとして扱わず、適切なウェブレイアウトを追加します。
はい。ダウンロードしたファイルをテキストエディターまたは HTML エディターで開きます。公開ページで使用する前に、抽出された文字を確認し、適切な構造を追加してください。
次のツールもご利用ください:HTMLをPDFに変換, PDFをOCR処理, PDFをテキストに変換.