PDFをOCR処理

スキャン文字を認識し、元のページの見た目を保ったまま検索可能にします。

PDF ファイルを選択

ここにファイルをドロップするか、下のボタンで選択してください。

最大 100 MB 合計 · ファイルは端末内に保持

目次セクション: 12

PDF に OCR が必要になるのはどのような場合ですか?

ブラウザーで動作するTesseractを使い、スキャンしたPDFに検索可能なテキスト層を追加します。原文に合う言語を選んでください。初期値は日本語です。対応するビューアーで認識文字を検索・選択でき、スキャンページの元の見た目も保たれます。

標準では、すでに文字を含むページを保持します。選択した全ページを認識することもできますが、新しい層を追加するため、既存の文字が重複する場合があります。OCR の精度は、ピント、コントラスト、言語、ページの傾きに左右されます。小さな印字、手書き、特殊な書体、ノイズの多いスキャンは、自動的に信頼せず、丁寧な確認が必要です。

PDF の OCR 機能

検索可能な PDF または TXT

認識した文章をプレーンテキストとしてダウンロードするか、見た目を保持したスキャンにテキスト層を重ねた PDF を作成します。

最大 20 ページを選択

ダウンロードには選択したページだけが含まれます。最大 20 ページを選択してください。「ページ」を空欄にして文書全体を含められるのは、20 ページ以下の場合だけです。

認識の設定

原文の言語、200または300 DPI、認識時の回転を選びます。レイアウトは自動、単一のテキストブロック、散在する文字から選択します。対応言語は下のFAQにまとめています。

標準では既存の文字を保持

すでに文字を含むページを保持できます。テキスト層が重複する可能性を考慮したうえでのみ、強制認識を使用してください。

スキャンに検索可能なテキスト層を追加するのはなぜですか?

スキャンはページを画像として保存するため、通常の文字検索では印刷された語句を見つけられません。選択した言語の OCR によって、活字のスキャンを検索可能にし、コピーと貼り付けや後のテキスト抽出に使う文章を取得できます。ページをデザインし直すことより、既知の名前や語句を見つけることが重要な保存資料で特に役立ちます。スキャンが鮮明に見えても、認識した層には誤りが含まれる場合があります。検索と選択を試し、抽出した文章を使う前に、名前、参照番号、数値をページ画像と比較してください。

PDF スキャンの OCR は誰が使いますか?

図書館と記録の担当者

短い印刷文書を、表題、名前、参照番号で検索できるようにします。元のスキャンを残し、紛らわしい文字も含めて、ダウンロードしたコピーで検索語を試してください。

スキャンした配布資料を持つ学生

学習ノートを作る前に、活字の授業ノートを検索可能にします。手書きの注釈は信頼できない場合があるため、引用する部分をスキャンと照合してください。

日常的な人事業務の担当者

承認されたスキャン済みメモから文章を抽出し、社内の索引に使います。認識された 1 文字だけで識別子が変わる場合があるため、日付、職員名、参照番号を慎重に比較してください。

スキャンした PDF を検索可能にするにはどうすればよいですか?

  1. 暗号化されていないスキャンを選び、20ページ以内を指定します。ダウンロードするPDFには選択したページだけが含まれます。初めて扱う種類のスキャンでは、少ないページで試してください。
  2. 「テキストの言語」でソースの言語を選択します。「検索可能な PDF」または「プレーンテキスト」を選び、認識解像度を設定して、必要なら回転やページレイアウトを選択してください。
  3. 標準の設定で既存の文字を保持するか、意図的に「選択した全ページを認識」を選びます。OCR を開始し、認識が完了するまで待ってください。
  4. 結果をダウンロードします。既知の語句を検索し、1 行をコピーして、綴りと数値を元のスキャンと比較してください。

元ファイルを選択

対応言語のスキャンを選び、20ページ以内を指定します。

スクリーンショットを選択すると拡大できます。
PDFをOCR処理、手順1:対応言語のスキャンを選び、20ページ以内を指定します。

ツールの設定を確認

元の言語、OCRの出力、解像度、レイアウト、文字認識の向きを選択します。

スクリーンショットを選択すると拡大できます。
PDFをOCR処理、手順2:元の言語、OCRの出力、解像度、レイアウト、文字認識の向きを選択します。

結果をダウンロードして確認

ダウンロードし、認識した文字を元のスキャンと照合します。

スクリーンショットを選択すると拡大できます。
PDFをOCR処理、手順3:ダウンロードし、認識した文字を元のスキャンと照合します。

スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。

画像だけのチェックリストを検索可能にする

元のページは、抽出できる文字のない画像です。OCR はページの見た目を保ちながらテキスト層を追加します。そのため両方の画像は同じ見た目ですが、ダウンロードできる結果には認識した文字も含まれます。

処理前:画像だけのページ

ソースから抽出できた文字は 0 文字です。

選択可能なテキスト層がない、OCR 前の実際の画像だけのチェックリスト。

処理後:同じページに検索可能な文字

結果にはサンプルの6行すべてが含まれています。検証した1,300ピクセルの画像サイズでは、描画したピクセルが元のファイルと一致しました。

同じ見た目のチェックリストと新しいテキスト層を含む、実際の検索可能な結果 PDF。
元の文字
0文字
結果の文字
80文字
認識の確認
PDFに保存された認識結果が、サンプルの6行すべてと一致
この結果から抽出したテキストを読む
文書の確認リスト
ページの順番を確認します
元のファイルを保管します
共有前に氏名と数値を確認します
文字が鮮明に読めるか確認します
これは架空のテスト文書です

使用した設定: ページ 1。検索可能な PDF。200 DPI で認識。単一のテキストブロック。日本語。元の向き。

この鮮明で文字の大きい日本語サンプルは、小さい文字、手書き、傾いたスキャン、他言語での精度を示すものではありません。外部のテキスト抽出ソフトによっては、文字の位置に応じて余分な空白が入ることがあります。このツールは認識した元の文字を保持します。実際の結果では氏名、金額、日付を校正してください。

確認日:。このテーマのバージョン3.15.0を使用し、ローカルのChromiumブラウザーで機密情報を含まない日本語サンプルを処理しました。これらの例で確認できるのは提供したファイルの処理結果であり、本番サーバーの性能試験ではありません。 3.18.0 版では、このダウンロード用サンプル PDF の埋め込みフォントから未使用の字形を削減しました。ページの見た目と抽出テキストが元の結果と一致することを確認しています。ダウンロードサイズとチェックサムは最適化後のコピーの値です。

設定と出力の確認

設定想定される動作
対応する入力PDF
処理場所お使いの端末のブラウザー
ファイル選択入力ファイル 1 個
入力サイズ最大 100 MB。ただし端末のメモリーと展開したページの上限も適用されます
認識するページのまとまり選択できるのは最大 20 ページ。検索可能な PDF のダウンロードには、それらのページだけが含まれます。

このツールはテキスト層を追加するものであり、表を編集可能な表計算として再構築したり、内容の事実を訂正したりはしません。OCR は、名前、口座番号、その他の正確さが重要な文字を確認する代わりにはなりません。

スキャンの見た目を変えずに認識方向を確認する

回転設定は、認識に渡す描画済みのスキャンを回転させます。検索可能な PDF は元のページの見た目を保持します。読者に正しい向きで見せたい場合の「PDFを回転」の代わりではありません。既存のテキスト層に誤りがある場合、強制認識によって別の層が追加され、検索結果が重複することがあります。そのような場合、プレーンテキスト OCR は確認済みの抽出結果を得るのに役立ちます。0/O、1/l、小数点など、混同しやすい文字を画像と照合してください。

PDF の OCR で問題が起きた場合

状況対処方法
名前や数値が間違っている認識された文字を画像と比較します。再利用する前に、後の処理に適したエディターで修正してください。
既存の誤った OCR 層が改善しない「選択した全ページを認識」を選び、新しい層を追加します。既存の文字は保持されるため、既存の層によって検索結果が重複する場合があります。重複のない抽出が必要な場合は、プレーンテキストを書き出してください。
長い資料一式が拒否される20 ページ以下のまとまりに分け、それぞれ OCR 処理して確認してから結合してください。

実用例と最終確認

活字の点検表では、検索可能な PDF で既知の機器 ID を検索し、その ID と測定値を 1 つテキストエディターにコピーします。両方をスキャンと比較し、選択時に意図した行が強調表示されることを確認してください。語句の検索に成功しただけでは、正しい読み順や信頼できる数値抽出は確認できません。

よくある質問

OCR はページを編集可能な Word の内容に変えますか?

出力は、テキスト層を追加した PDF のままです。文字を流し直した文書が必要なら、後から「PDFをWordに変換」を使用してください。

どの言語を利用できますか?

この版には、英語、スペイン語、ポルトガル語、ドイツ語、インドネシア語、ロシア語、フランス語、イタリア語、トルコ語、アラビア語、簡体字中国語、日本語、韓国語、ポーランド語、ヒンディー語の認識モデルが含まれます。日本語版の初期値は日本語です。ソースに合う言語を選択してください。OCR は文字を認識しますが、文書を翻訳しません。その他の言語には、別途設定した OCR の処理が必要です。

ページがスキップされたのはなぜですか?

標準設定は、既存のテキスト層があるページを保持します。それらも認識するには、「選択した全ページを認識」を選択してください。

選択しなかったページも出力に含まれますか?

いいえ。検索可能な PDF には選択したページだけが含まれます。長い文書をまとめて保持するには、最大 20 ページずつ認識し、確認した出力を元の順序で結合してください。

認識用の回転は PDF ページの見た目も回転させますか?

いいえ。認識に渡す画像を回転させますが、PDF 内の元のページの見た目は保持します。保存したページ自体を正しい向きで表示したい場合は、先に「PDFを回転」を使用してください。

このツールは手書きを確実に読んだり表を再構築したりできますか?

このツールは選択した言語の文字を認識します。手書きを確実に読めるとは限らず、表のセルも再構築しません。鮮明で正しい向きの印刷文字のスキャンを使い、Wordや表計算ソフトに移す前に文字を確認してください。

関連ツールとガイド

次のツールもご利用ください:PDFをWordに変換、PDFをテキストに変換、スキャンをPDFに変換。長期保存の要件については、こちらをご覧ください:PDFをPDF/Aに変換。検索可能な PDF が自動的に PDF/A になるわけではありません。