PDFをXMLに変換

PDFのテキスト項目とページの幾何情報を、仕様が明示されたXML構造に抽出します。

PDF ファイルを選択

ここにファイルをドロップするか、下のボタンで選択してください。

最大 25 MB 合計 · ファイルは端末内に保持

目次セクション: 10

XMLの出力には何が含まれますか?

PDFの選択可能なテキスト層をXMLとして書き出します。元のページ番号ごとにテキスト項目をまとめ、ページの幾何情報、テキスト方向、位置の変換情報を記録します。確認や後続処理に使える構造化された根拠データになります。

XMLが表すのは、PDFのテキストリーダーが抽出した内容です。文書の作成に使われた可能性がある元のXMLではなく、請求書の項目の識別、表の関係の再構築、画像の書き出しも行いません。画像だけのページには先にOCRが必要です。

PDFからXMLへの変換機能

ページごとの要素

元のページ番号、回転、見えるページ範囲を、抽出テキストと一緒に保持します。選択した範囲を確認するときの参照になります。

エスケープされたテキスト値

アンパサンドや山括弧などは、XML要素内のデータとして保持されます。マークアップに見える文字列が、この書き出しによって実行可能なページ内容になることはありません。

特殊な文字列も復元可能

XMLで直接表せない文字には、明示的な印を付けたJSON文字列エンコードを使います。受信側プログラムはこの印に従い、値を正確に復元できます。

ブラウザー内で処理

お使いの端末でXMLファイルを作成します。元のファイルは変換用にアップロードされず、書き換えられません。

PDFからXMLを抽出するには?

  1. 選択可能なテキストを含む、暗号化されていないPDFを選びます。
  2. 「ページ」に必要なページ番号や範囲を入力します。
  3. ファイルを変換し、XMLの結果をダウンロードします。
  4. テキストエディターまたはXML対応アプリケーションで開きます。
  5. 要素を別のシステムに対応付ける前に、既知のページと語句を比較します。

元のPDFを選択

読み取り可能なテキスト層を持つPDFを選びます。

スクリーンショットを選択すると拡大できます。
PDFからXML:元のPDFの選択。

ページ範囲を限定

XML抽出に必要なページを選びます。

スクリーンショットを選択すると拡大できます。
PDFからXML:ページ範囲と抽出の制限。

XMLを保存

XMLをダウンロードし、ページ要素を確認します。

スクリーンショットを選択すると拡大できます。
PDFからXML:完成したXML出力のダウンロード。

スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。

PDFテキストの確認にXMLを使う理由は?

XMLを使う処理では、独自の変換規則を適用する前に、明確なページ要素と項目要素が必要な場合があります。チームはこれらを確認し、元のページへの参照を保持して、既知の文書種類に対する別の対応付けを作れます。対応付けと抽出は区別してください。テキスト項目が近くにあるだけでは、業務上の関係は確定しません。

このXML出力は誰に役立ちますか?

システム連携の開発者

管理された文書処理の入力として、ページ要素と項目要素を使えます。

文書の保存担当者

保管している元のPDFとあわせて、テキストが利用可能な状態かを確認できます。

データ監査担当者

変換規則を採用する前に、出力値のサンプルを元のページと比較できます。

設定と出力の確認

設定出力の内容
元のファイルPDFは1ファイル、最大25 MiB。元の文書は500ページ以内です。
ページ範囲最大200ページを選択できます。範囲を空欄にして全ページを含められるのは、この上限内の場合だけです。
テキストの制限1ページ20,000項目、1回の処理100,000項目、テキスト200万文字までです。
ダウンロード最大64 MiBのXML文書。外部のDTDやスキーマは取得しません。

ページを確認してから既知のラベルを対応付ける

納品書では、まず1ページを書き出して見慣れた参照番号を探します。そのテキスト変換と近くの項目を、元のページと比較してください。その後、アプリケーション側でその文書種類のルールを適用できます。無関係なレイアウトで、近くの数字をすべて同じフィールドと見なさないようにしてください。

PDFからXMLへの変換で困ったとき

状況確認する点
取引先のスキーマとXMLが一致しない出力には独自の抽出構造を使います。受信システムが求めるスキーマへの対応付けを別に作成してください。
要素にencoding属性があるencodingがjsonの場合、そのテキストをJSON文字列として解析すると、XMLに直接記述できない文字を復元できます。
文字が欠ける、または順序が想定と異なるスキャンページや特殊なテキスト配置がないか確認してください。必要に応じてOCRを実行し、座標を調べてください。

よくある質問

PDFからXMLへの変換で元のソースXMLを復元できますか?

いいえ。通常、PDFには元のデータモデルは残りません。この出力が記録するのは、リーダーが抽出できるテキスト層と幾何情報です。

PDFのタグはXMLの文書モデルに変換されますか?

いいえ。タグ付きPDFの意味構造、見出し、表の構造は再構築しません。ページ要素と項目要素は抽出結果を記述します。

このXMLを同じPDFに戻せますか?

XMLからPDFへの変換ツールはXMLソースを印刷できますが、この抽出ファイルから元のページデザインを再現することはできません。元のPDFを保持してください。

関連ツール

XMLをPDFに変換, PDFをJSONに変換, PDFの文字認識.