PDFをテキストに変換

既存のテキストレイヤーをUTF-8のテキストファイルに抽出します。

PDF ファイルを選択

ここにファイルをドロップするか、下のボタンで選択してください。

最大 100 MB 合計 · ファイルは端末内に保持

目次セクション: 11

PDF からプレーンテキストとして何を抽出できますか?

PDF の既存のテキスト層を抽出し、検索、コピー、追加編集に利用します。行はページ内の位置に基づいてまとめられます。文章中心のレポートや文書の保管資料に特に役立ちます。

出力はフォント、画像、ページデザインを含まないプレーンテキストです。複数段組みのページでは、読み順が見た目の配置と異なる場合があります。テキスト層のないスキャンページは、この操作で文字起こしできません。

PDF からテキストへの変換機能

既存の文字を抽出

スキャン画像の文字を認識するのではなく、文書内の選択可能なテキスト層を読み取ります。

関連するページを選択

「ページ」欄で、書き出し対象を章、手紙、付録などに絞ります。

扱いやすい TXT 出力

ワープロのレイアウトを伴わず、一般的なテキストエディターで開けるプレーンテキストファイルをダウンロードします。

位置に基づく行のグループ化

近接する文字の断片を行にまとめます。複数段組みの読み順は、引き続き元のページとの比較が必要です。

PDF の文章をテキストファイルに変換するのはなぜですか?

印刷されたレイアウトよりも文章が重要な場合、プレーンテキストが役立ちます。端末内のフォルダーを検索したり、文章をエディターへコピーしたり、ノート作りのための整理された出発点を用意したりできます。文字を扱う作業に、画像の多いページデザインを持ち込まずに済む利点もあります。テキスト層は、ページに見える内容と常に同一とは限りません。合字、見えない OCR の誤り、段組みの順序によって抽出結果が変わる場合があります。次の作業に使う前に、代表的な段落と重要な名前や数値を確認してください。

抽出した PDF の文字は誰が使いますか?

大学の研究者

使用が許可された論文の文字を書き出して、引用を集め、読書ノートを作成します。各引用を元のページと照合し、ページ番号を別途記録してください。

事務担当者

定型的な手紙の文章をテキストエディターへ移して、改訂の下書きを作ります。組織のテンプレートに移す前に、宛名、日付、改行を確認してください。

技術文書の執筆者

仕様書の文章を取り出し、検索可能な作業メモにします。特殊なフォントの符号化により抽出文字が変わる場合があるため、単位、記号、番号付きの手順を PDF と比較してください。

PDF から文字を抽出するにはどうすればよいですか?

  1. 文字を選択できる PDF を選びます。画像だけのスキャンであれば、先に OCR でテキスト層を作成してください。
  2. 抽出するページを入力するか、「ページ」を空欄にして文書全体を対象にします。必要ならダウンロード名を追加してください。
  3. 抽出を実行して TXT ファイルをダウンロードし、テキストエディターで開きます。
  4. 文章の編集や引用を行う前に、段落の順序、句読点、名前、重要な数値を元の PDF と比較してください。

元ファイルを選択

既存の選択可能なテキストレイヤーがあるPDFを選択します。

スクリーンショットを選択すると拡大できます。
PDFをテキストに変換、手順1:既存の選択可能なテキストレイヤーがあるPDFを選択します。

ツールの設定を確認

ページを選び、必要に応じてダウンロード名を指定します。

スクリーンショットを選択すると拡大できます。
PDFをテキストに変換、手順2:ページを選び、必要に応じてダウンロード名を指定します。

結果をダウンロードして確認

TXTファイルをダウンロードし、その文字をPDFと照合します。

スクリーンショットを選択すると拡大できます。
PDFをテキストに変換、手順3:TXTファイルをダウンロードし、その文字をPDFと照合します。

スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。

設定と出力の確認

設定想定される動作
対応する入力PDF
処理場所お使いのブラウザー
ファイル選択入力ファイル 1 個
入力サイズ合計 100 MB。展開した画像とページにはピクセル数の上限もあります
ページの選択1 回の処理で最大 200 ページを選択できます。「ページ」の空欄が全ページを意味するのは、PDF が 200 ページ以下の場合だけです。より長い文書には範囲を分けて使用してください。

ページがスキャンで文章を選択できない場合は、テキスト抽出を使用する前に OCR テキスト層を追加し、確認してください。

読み順と符号化された文字を確認する

PDF 内の文字の断片は、見える位置とは異なる順序で格納されることがあります。サイドバー、脚注、2 段組みは、書き出した文が途中で分断される一般的な原因です。見える文字がフォントの対応表に依存し、抽出時に同じ文字が渡されない場合もあります。TXT を信頼できる元の文章として扱う前に、段やページの境界をまたぐ段落を比較し、技術記号や「fi」などの合字を確認してください。

PDF からテキストへの変換で問題が起きた場合

状況対処方法
テキストファイルが空、または変換が拒否される選択したページにテキスト層がない可能性があります。利用できる場合は先に OCR を使用してください。
一部の文字が正しくないPDF の文字の符号化や OCR 層に不具合がある可能性があります。名前、数値、記号を見えるページと比較してください。
編集可能で書式付きの文書が必要DOCX の作業用の出発点には「PDFをWordに変換」を使用してください。正確なレイアウトの確認は引き続き必要です。

実用例と最終確認

左列に A1, A2、右列に B1, B2 があるとします。位置による行のまとめ方によっては、A1 B1、次に A2 B2 となり、列が混ざることがあります。抽出行を並べ直す前に PDF の各列を読んでください。見た目が整ったテキストでも、無関係な文がつながる場合があります。

よくある質問

スキャンした PDF から文字を抽出できますか?

先に OCR を実行して認識した文字を追加してください。画像だけのソースを選択すると、文字がないことを示す明確なメッセージが表示されます。

段落は保持されますか?

位置に基づく行のグループ化で、おおよその行順を再現します。段落区切りや複雑な段組みは、文章の確認と修正が必要です。

ダウンロードしたテキストではページをどう区切りますか?

選択したページの文字を空行でつなぎます。PDF に戻れる正確な引用が必要な場合は、実際のページ範囲をノートに残してください。

関連ツールとガイド

次のツールもご利用ください:PDFをOCR処理、PDFリーダー。別の言語での出力については、こちらをご覧ください:PDF を翻訳する手順。テキスト抽出そのものは翻訳を行いません。