PDFをYAMLに変換

PDFのテキスト項目とページ内の位置をYAMLデータとして書き出します。

PDF ファイルを選択

ここにファイルをドロップするか、下のボタンで選択してください。

最大 25 MB 合計 · ファイルは端末内に保持

目次セクション: 10

PDFからYAMLには何を書き出せますか?

選択したPDFページから抽出したテキスト項目を含むYAMLファイルを作成します。元のページへの参照、ページの幾何情報、テキスト位置の変換情報が入り、テキストエディターでの確認や別の処理に利用できます。

文書をアプリケーション設定として解釈するものではありません。見出し階層の推定、画像の抽出、請求書の項目の認識、見た目からの表の再構築はできません。テキストはPDFリーダーの抽出順序に従い、読む順序とは異なる場合があります。

PDFからYAMLへの変換機能

引用符付きの文字列値

yesのような単語、日付、句読記号、コロンを含む語句を文字列値として保持します。抽出テキストがYAMLの命令や独自のオブジェクトタグになることはありません。

元のページへの参照

選択したページは元のページ番号を保ちます。確認者は出力配列の位置を数えずに、対応するPDFページへ戻れます。

テキストの幾何情報

文字と一緒に、テキストの変換、方向、ページ寸法を保存します。後続処理では完成済みの表と仮定せず、配置を調べられます。

抽出範囲を明示

出力には、意味構造の再構築とOCRを行っていないことを明示します。別のプログラムが抽出された根拠データとして扱う際に役立ちます。

PDFのテキストをYAMLに変換するには?

  1. 選択可能なテキストを含む、暗号化されていないPDFを1つ選びます。
  2. 小さなページ範囲を入力します。文書全体が選択上限内であれば、「ページ」を空欄にすることもできます。
  3. 変換を開始し、.yamlファイルを保存します。
  4. YAML対応エディターで出力を開き、ページと項目の記録を確認します。
  5. 重要な文字列と位置を別の処理で使う前に、元のPDFと比較します。

PDFを選択

確認したいテキストを含むPDFを選びます。

スクリーンショットを選択すると拡大できます。
PDFからYAML:サンプルPDFの選択。

抽出範囲を選択

元の文書の少ないページ数から始めます。

スクリーンショットを選択すると拡大できます。
PDFからYAML:構造化データに書き出すページの選択。

YAMLをダウンロード

出力を保存し、引用符付きのテキスト値を確認します。

スクリーンショットを選択すると拡大できます。
PDFからYAML:完成した構造化データのダウンロード。

スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。

PDFのテキストをYAMLに書き出す理由は?

専用ビューアーなしで構造化されたページ情報を確認したいチームには、YAMLが便利な場合があります。出力は文書データとして使い、取り込む前に独自の検証を行ってください。PDFの明細書の文字がYAMLファイルに保存されただけで、信頼できる設定になるわけではありません。

YAML抽出は誰に役立ちますか?

自動化の開発者

既知の文書レイアウト用の抽出ルールを設計する前に、テキストとページ参照を確認できます。

研究チーム

選んだ引用文やページ上の位置を調べながら、読みやすい中間記録を保持できます。

技術レビュー担当者

構造化テキストファイルに対応するツールで、抽出した文書データの変更を比較できます。

設定と出力の確認

設定出力の内容
入力ファイルPDFは1ファイル、最大25 MiB。元の文書は500ページまでです。
選択するページ入力順に最大200ページ。重複して指定したページは1回だけ含まれます。
抽出の上限1ページ20,000項目、1回の処理100,000項目、テキスト200万文字までです。
YAML出力引用符付き文字列値を使い、YAML 1.2と宣言します。ダウンロードは最大64 MiBです。

印字された値をテキストとして保持

フォームには、ラベルの横にyesという単語や先頭にゼロがある数字が印刷されている場合があります。YAML内の抽出文字列を確認し、元の文書と比較してください。テキストは引用符付きの値として保持されるため、ラベル、識別子、日付、その他の値のどれかは、利用者のアプリケーションで判断できます。

PDFからYAMLへの変換で困ったとき

状況確認する点
テキストにUnicodeエスケープ列が含まれるYAML解析プログラムは、引用符内のエスケープから元の文字を復元できます。制御文字がファイル構造を乱すことも防げます。
そのまま取り込める設定ファイルではないこれは抽出記録です。アプリケーションに必要なフィールドの対応付けと検証は、別に行ってください。
選択した内容の密度が高すぎるページ範囲を減らしてください。密度の高いページは、ページ数の上限より先にテキスト項目数や文字数の上限に達する場合があります。

よくある質問

このツールはYAML入力を読み込んだり実行したりしますか?

いいえ。PDFを読み込み、YAMLを書き出します。アップロードされたYAMLの読み込み、タグの実行、設定の適用は行いません。

スキャンページの文字を認識できますか?

自動OCRは行いません。画像だけのPDFには先にOCRを実行し、認識したテキストを確認してから書き出してください。

抽出項目はすでに読む順序に並んでいますか?

必ずしもそうではありません。複数段のページや位置指定されたラベルでは、抽出順序が異なる場合があります。座標と元のページを確認してください。

関連ツール

PDFをJSONに変換, PDFをXMLに変換, PDFの文字認識.