PDFをJSONに変換

選択可能なテキスト、ページの幾何情報、テキスト位置をJSONとして書き出します。

PDF ファイルを選択

ここにファイルをドロップするか、下のボタンで選択してください。

最大 25 MB 合計 · ファイルは端末内に保持

目次セクション: 10

PDFからJSONには何を抽出できますか?

PDFのテキスト層を、確認や後続処理に使えるJSONファイルに変換します。選択したページ、その寸法、PDFリーダーが返すテキスト項目を、位置や変換情報とともに記録します。

PDFはページを表示するための命令を保存しています。このツールは請求書の項目を推定したり、表を再構築したり、元の見出し階層を判定したりしません。スキャンページの文字を書き出すには、先にOCRによる文字認識が必要です。

PDFからJSONへの変換機能

ページの選択

元のページ番号を保持して、指定したページ範囲を書き出せます。長い文書を処理する前に、小さなサンプルを確認しやすくなります。

座標付きのテキスト

テキスト項目をページの幾何情報や配置情報とともに保持します。座標の意味を読み取り、項目同士の見た目上の関係を確かめる際は、元のPDFを参照してください。

機械で読み取れる出力

独自の解析プログラムや確認作業で使える有効なJSONをダウンロードできます。書き出されるテキストはデータとしてエスケープされ、文書の内容が実行されることはありません。

端末内で処理

選択したPDFをブラウザーで読み取ります。文書は変換サーバーに送信されず、元のファイルも変更されません。

PDFのテキストをJSONに変換するには?

  1. リーダーでテキストを選択できる、暗号化されていないPDFを選びます。
  2. 1, 3-5などのページ番号を入力します。制限内の全ページを含める場合は「ページ」を空欄にします。
  3. 変換を開始し、JSONファイルをダウンロードします。
  4. JSONの表示ソフトやエディターで開き、知っている語句を対応するPDFページと比較します。
  5. 別のアプリケーションでデータを使う前に、座標、読む順序、空白ページの有無を確認します。

PDFを選択

選択可能なテキストを含むPDFを選びます。

スクリーンショットを選択すると拡大できます。
PDFからJSON:テキスト層のあるサンプルPDFの選択。

ページを選択

ページ範囲を指定し、抽出の制限を確認します。

スクリーンショットを選択すると拡大できます。
PDFからJSON:ページ選択と抽出設定。

JSONをダウンロード

JSONを保存し、元のページと比較します。

スクリーンショットを選択すると拡大できます。
PDFからJSON:完成した構造化テキストのダウンロード。

スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。

PDFのテキストをJSONに書き出す理由は?

文書処理でテキストと位置の両方が必要な場合に、JSONが役立ちます。開発者は抽出品質を調べたり、繰り返し現れるラベルを探したり、別の対応付け処理を準備したりできます。その対応付けは明確に定義してください。近くにある金額が自動的に請求総額になるわけではなく、抽出順序が人の読む順序に一致する保証もありません。

この書き出し機能は誰に役立ちますか?

文書処理の開発者

解析プログラムを作る前にテキスト層を確認し、デバッグ用にページ参照を保持できます。

データ確認チーム

抽出ルールを採用する前に、値のサンプルを元のページと比較できます。

学生と研究者

固定レイアウトの文書内で、見える文字がどのように表現されているかを調べられます。

設定と出力の確認

設定出力の内容
入力PDFは1ファイル、最大25 MiB。元の文書は最大500ページです。
選択範囲選択は最大200ページ。テキスト項目は1ページ20,000件、1回の処理100,000件、テキストは200万文字までです。
出力抽出したテキストと幾何情報を含むJSON。最大64 MiBです。
スキャンページ自動OCR、画像の書き出し、文書フィールドの認識は行いません。

解析プログラムを作る前に小さなサンプルを確認

2段組の明細書では、まず1ページを書き出してください。見慣れたラベルを見つけ、位置を印字された値と比べます。両方の段の項目が入り交じる場合は、配列が完成済みの表だと考えず、独自のコードで座標を使ってグループ化してください。

PDFからJSONへの変換で困ったとき

状況確認する点
選択可能なテキストが見つからないスキャンページにOCRを実行し、生成されたPDFのテキスト層を書き出してください。
テキストの順序が想定と異なるページとテキスト位置を比較してください。抽出順序が読む順序を示すとは限りません。
広い範囲を選ぶと拒否されるページ数を減らしてください。密度の高いページは、ページ数の上限より先にテキスト項目の上限に達する場合があります。

よくある質問

PDFからJSONへの変換で請求書の項目を認識できますか?

いいえ。結果に含まれるのはテキスト項目と幾何情報です。フィールド名や関係の判定、業務上の検証には、別の対応付け処理が必要です。

画像や表は含まれますか?

画像は書き出されません。表内のテキストは抽出できますが、行と列の関係は再構築されません。

このJSONから元のPDFを再作成できますか?

この出力は確認用の形式であり、PDFの完全な表現ではありません。見た目、図形、フォント、対話機能を保持するため、元のPDFを保存してください。

関連ツール

JSONをPDFに変換, PDFをXMLに変換, PDFの文字認識.