検索可能な PDF または TXT
認識した文章をプレーンテキストとしてダウンロードするか、見た目を保持したスキャンにテキスト層を重ねた PDF を作成します。
スキャン文字を認識し、元のページの見た目を保ったまま検索可能にします。
ここにファイルをドロップするか、下のボタンで選択してください。
最大 100 MB 合計 · ファイルは端末内に保持
ここで文書をプレビューできます。追加する内容の位置は目安です。保存した出力を確認してください。
ブラウザーで動作するTesseractを使い、スキャンしたPDFに検索可能なテキスト層を追加します。原文に合う言語を選んでください。初期値は日本語です。対応するビューアーで認識文字を検索・選択でき、スキャンページの元の見た目も保たれます。
標準では、すでに文字を含むページを保持します。選択した全ページを認識することもできますが、新しい層を追加するため、既存の文字が重複する場合があります。OCR の精度は、ピント、コントラスト、言語、ページの傾きに左右されます。小さな印字、手書き、特殊な書体、ノイズの多いスキャンは、自動的に信頼せず、丁寧な確認が必要です。
認識した文章をプレーンテキストとしてダウンロードするか、見た目を保持したスキャンにテキスト層を重ねた PDF を作成します。
ダウンロードには選択したページだけが含まれます。最大 20 ページを選択してください。「ページ」を空欄にして文書全体を含められるのは、20 ページ以下の場合だけです。
原文の言語、200または300 DPI、認識時の回転を選びます。レイアウトは自動、単一のテキストブロック、散在する文字から選択します。対応言語は下のFAQにまとめています。
すでに文字を含むページを保持できます。テキスト層が重複する可能性を考慮したうえでのみ、強制認識を使用してください。
スキャンはページを画像として保存するため、通常の文字検索では印刷された語句を見つけられません。選択した言語の OCR によって、活字のスキャンを検索可能にし、コピーと貼り付けや後のテキスト抽出に使う文章を取得できます。ページをデザインし直すことより、既知の名前や語句を見つけることが重要な保存資料で特に役立ちます。スキャンが鮮明に見えても、認識した層には誤りが含まれる場合があります。検索と選択を試し、抽出した文章を使う前に、名前、参照番号、数値をページ画像と比較してください。
短い印刷文書を、表題、名前、参照番号で検索できるようにします。元のスキャンを残し、紛らわしい文字も含めて、ダウンロードしたコピーで検索語を試してください。
学習ノートを作る前に、活字の授業ノートを検索可能にします。手書きの注釈は信頼できない場合があるため、引用する部分をスキャンと照合してください。
承認されたスキャン済みメモから文章を抽出し、社内の索引に使います。認識された 1 文字だけで識別子が変わる場合があるため、日付、職員名、参照番号を慎重に比較してください。
対応言語のスキャンを選び、20ページ以内を指定します。
スクリーンショットを選択すると拡大できます。
元の言語、OCRの出力、解像度、レイアウト、文字認識の向きを選択します。
スクリーンショットを選択すると拡大できます。
ダウンロードし、認識した文字を元のスキャンと照合します。
スクリーンショットを選択すると拡大できます。
スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。
元のページは、抽出できる文字のない画像です。OCR はページの見た目を保ちながらテキスト層を追加します。そのため両方の画像は同じ見た目ですが、ダウンロードできる結果には認識した文字も含まれます。
ソースから抽出できた文字は 0 文字です。

結果にはサンプルの6行すべてが含まれています。検証した1,300ピクセルの画像サイズでは、描画したピクセルが元のファイルと一致しました。

文書の確認リスト ページの順番を確認します 元のファイルを保管します 共有前に氏名と数値を確認します 文字が鮮明に読めるか確認します これは架空のテスト文書です
使用した設定: ページ 1。検索可能な PDF。200 DPI で認識。単一のテキストブロック。日本語。元の向き。
この鮮明で文字の大きい日本語サンプルは、小さい文字、手書き、傾いたスキャン、他言語での精度を示すものではありません。外部のテキスト抽出ソフトによっては、文字の位置に応じて余分な空白が入ることがあります。このツールは認識した元の文字を保持します。実際の結果では氏名、金額、日付を校正してください。
確認日:。このテーマのバージョン3.15.0を使用し、ローカルのChromiumブラウザーで機密情報を含まない日本語サンプルを処理しました。これらの例で確認できるのは提供したファイルの処理結果であり、本番サーバーの性能試験ではありません。 3.18.0 版では、このダウンロード用サンプル PDF の埋め込みフォントから未使用の字形を削減しました。ページの見た目と抽出テキストが元の結果と一致することを確認しています。ダウンロードサイズとチェックサムは最適化後のコピーの値です。
| 設定 | 想定される動作 |
|---|---|
| 対応する入力 | |
| 処理場所 | お使いの端末のブラウザー |
| ファイル選択 | 入力ファイル 1 個 |
| 入力サイズ | 最大 100 MB。ただし端末のメモリーと展開したページの上限も適用されます |
| 認識するページのまとまり | 選択できるのは最大 20 ページ。検索可能な PDF のダウンロードには、それらのページだけが含まれます。 |
このツールはテキスト層を追加するものであり、表を編集可能な表計算として再構築したり、内容の事実を訂正したりはしません。OCR は、名前、口座番号、その他の正確さが重要な文字を確認する代わりにはなりません。
回転設定は、認識に渡す描画済みのスキャンを回転させます。検索可能な PDF は元のページの見た目を保持します。読者に正しい向きで見せたい場合の「PDFを回転」の代わりではありません。既存のテキスト層に誤りがある場合、強制認識によって別の層が追加され、検索結果が重複することがあります。そのような場合、プレーンテキスト OCR は確認済みの抽出結果を得るのに役立ちます。0/O、1/l、小数点など、混同しやすい文字を画像と照合してください。
| 状況 | 対処方法 |
|---|---|
| 名前や数値が間違っている | 認識された文字を画像と比較します。再利用する前に、後の処理に適したエディターで修正してください。 |
| 既存の誤った OCR 層が改善しない | 「選択した全ページを認識」を選び、新しい層を追加します。既存の文字は保持されるため、既存の層によって検索結果が重複する場合があります。重複のない抽出が必要な場合は、プレーンテキストを書き出してください。 |
| 長い資料一式が拒否される | 20 ページ以下のまとまりに分け、それぞれ OCR 処理して確認してから結合してください。 |
活字の点検表では、検索可能な PDF で既知の機器 ID を検索し、その ID と測定値を 1 つテキストエディターにコピーします。両方をスキャンと比較し、選択時に意図した行が強調表示されることを確認してください。語句の検索に成功しただけでは、正しい読み順や信頼できる数値抽出は確認できません。
出力は、テキスト層を追加した PDF のままです。文字を流し直した文書が必要なら、後から「PDFをWordに変換」を使用してください。
この版には、英語、スペイン語、ポルトガル語、ドイツ語、インドネシア語、ロシア語、フランス語、イタリア語、トルコ語、アラビア語、簡体字中国語、日本語、韓国語、ポーランド語、ヒンディー語の認識モデルが含まれます。日本語版の初期値は日本語です。ソースに合う言語を選択してください。OCR は文字を認識しますが、文書を翻訳しません。その他の言語には、別途設定した OCR の処理が必要です。
標準設定は、既存のテキスト層があるページを保持します。それらも認識するには、「選択した全ページを認識」を選択してください。
いいえ。検索可能な PDF には選択したページだけが含まれます。長い文書をまとめて保持するには、最大 20 ページずつ認識し、確認した出力を元の順序で結合してください。
いいえ。認識に渡す画像を回転させますが、PDF 内の元のページの見た目は保持します。保存したページ自体を正しい向きで表示したい場合は、先に「PDFを回転」を使用してください。
このツールは選択した言語の文字を認識します。手書きを確実に読めるとは限らず、表のセルも再構築しません。鮮明で正しい向きの印刷文字のスキャンを使い、Wordや表計算ソフトに移す前に文字を確認してください。
次のツールもご利用ください:PDFをWordに変換、PDFをテキストに変換、スキャンをPDFに変換。長期保存の要件については、こちらをご覧ください:PDFをPDF/Aに変換。検索可能な PDF が自動的に PDF/A になるわけではありません。