既存の文字を抽出
スキャン画像の文字を認識するのではなく、文書内の選択可能なテキスト層を読み取ります。
既存のテキストレイヤーをUTF-8のテキストファイルに抽出します。
ここにファイルをドロップするか、下のボタンで選択してください。
最大 100 MB 合計 · ファイルは端末内に保持
ここで文書をプレビューできます。追加する内容の位置は目安です。保存した出力を確認してください。
PDF の既存のテキスト層を抽出し、検索、コピー、追加編集に利用します。行はページ内の位置に基づいてまとめられます。文章中心のレポートや文書の保管資料に特に役立ちます。
出力はフォント、画像、ページデザインを含まないプレーンテキストです。複数段組みのページでは、読み順が見た目の配置と異なる場合があります。テキスト層のないスキャンページは、この操作で文字起こしできません。
スキャン画像の文字を認識するのではなく、文書内の選択可能なテキスト層を読み取ります。
「ページ」欄で、書き出し対象を章、手紙、付録などに絞ります。
ワープロのレイアウトを伴わず、一般的なテキストエディターで開けるプレーンテキストファイルをダウンロードします。
近接する文字の断片を行にまとめます。複数段組みの読み順は、引き続き元のページとの比較が必要です。
印刷されたレイアウトよりも文章が重要な場合、プレーンテキストが役立ちます。端末内のフォルダーを検索したり、文章をエディターへコピーしたり、ノート作りのための整理された出発点を用意したりできます。文字を扱う作業に、画像の多いページデザインを持ち込まずに済む利点もあります。テキスト層は、ページに見える内容と常に同一とは限りません。合字、見えない OCR の誤り、段組みの順序によって抽出結果が変わる場合があります。次の作業に使う前に、代表的な段落と重要な名前や数値を確認してください。
使用が許可された論文の文字を書き出して、引用を集め、読書ノートを作成します。各引用を元のページと照合し、ページ番号を別途記録してください。
定型的な手紙の文章をテキストエディターへ移して、改訂の下書きを作ります。組織のテンプレートに移す前に、宛名、日付、改行を確認してください。
仕様書の文章を取り出し、検索可能な作業メモにします。特殊なフォントの符号化により抽出文字が変わる場合があるため、単位、記号、番号付きの手順を PDF と比較してください。
既存の選択可能なテキストレイヤーがあるPDFを選択します。
スクリーンショットを選択すると拡大できます。
ページを選び、必要に応じてダウンロード名を指定します。
スクリーンショットを選択すると拡大できます。
TXTファイルをダウンロードし、その文字をPDFと照合します。
スクリーンショットを選択すると拡大できます。
スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。
| 設定 | 想定される動作 |
|---|---|
| 対応する入力 | |
| 処理場所 | お使いのブラウザー |
| ファイル選択 | 入力ファイル 1 個 |
| 入力サイズ | 合計 100 MB。展開した画像とページにはピクセル数の上限もあります |
| ページの選択 | 1 回の処理で最大 200 ページを選択できます。「ページ」の空欄が全ページを意味するのは、PDF が 200 ページ以下の場合だけです。より長い文書には範囲を分けて使用してください。 |
ページがスキャンで文章を選択できない場合は、テキスト抽出を使用する前に OCR テキスト層を追加し、確認してください。
PDF 内の文字の断片は、見える位置とは異なる順序で格納されることがあります。サイドバー、脚注、2 段組みは、書き出した文が途中で分断される一般的な原因です。見える文字がフォントの対応表に依存し、抽出時に同じ文字が渡されない場合もあります。TXT を信頼できる元の文章として扱う前に、段やページの境界をまたぐ段落を比較し、技術記号や「fi」などの合字を確認してください。
| 状況 | 対処方法 |
|---|---|
| テキストファイルが空、または変換が拒否される | 選択したページにテキスト層がない可能性があります。利用できる場合は先に OCR を使用してください。 |
| 一部の文字が正しくない | PDF の文字の符号化や OCR 層に不具合がある可能性があります。名前、数値、記号を見えるページと比較してください。 |
| 編集可能で書式付きの文書が必要 | DOCX の作業用の出発点には「PDFをWordに変換」を使用してください。正確なレイアウトの確認は引き続き必要です。 |
左列に A1, A2、右列に B1, B2 があるとします。位置による行のまとめ方によっては、A1 B1、次に A2 B2 となり、列が混ざることがあります。抽出行を並べ直す前に PDF の各列を読んでください。見た目が整ったテキストでも、無関係な文がつながる場合があります。
先に OCR を実行して認識した文字を追加してください。画像だけのソースを選択すると、文字がないことを示す明確なメッセージが表示されます。
位置に基づく行のグループ化で、おおよその行順を再現します。段落区切りや複雑な段組みは、文章の確認と修正が必要です。
選択したページの文字を空行でつなぎます。PDF に戻れる正確な引用が必要な場合は、実際のページ範囲をノートに残してください。
次のツールもご利用ください:PDFをOCR処理、PDFリーダー。別の言語での出力については、こちらをご覧ください:PDF を翻訳する手順。テキスト抽出そのものは翻訳を行いません。