フィールドの区切り文字を選択
次のアプリケーションの取り込み設定に合わせて、コンマ、セミコロン、タブで区切ったフィールドを書き出します。
位置に基づいてまとめた文字の行を、引用符で囲んだCSVデータに書き出します。
ここにファイルをドロップするか、下のボタンで選択してください。
最大 100 MB 合計 · ファイルは端末内に保持
ここで文書をプレビューできます。追加する内容の位置は目安です。保存した出力を確認してください。
位置に基づく PDF の文字の行を CSV ファイルに書き出し、表計算での確認やデータ取り込みに利用します。書き出し機能はセルを引用符で囲み、内部の引用符を 2 つにすることで、抽出文字を有効な CSV フィールド内に保ちます。
広い間隔は列を示す手がかりになりますが、表の構造の証明にはなりません。数式のような値には先頭にアポストロフィを付け、一般的な表計算で実行されないようにします。これは文字の見え方を変える場合があり、取り込み時に考慮する必要があります。
次のアプリケーションの取り込み設定に合わせて、コンマ、セミコロン、タブで区切ったフィールドを書き出します。
フィールドを引用符で囲み、内部の引用符を 2 つにするため、説明内のコンマはそのフィールド内にとどまります。
レポートの印刷上の間隔によってセルが誤って分かれる場合は、位置合わせの許容値、列間隔、除外する余白を調整します。
数式として解釈され得る文字で始まるセルには、アポストロフィを付けます。取り込みデータを対応付ける際に、この接頭辞を確認してください。
CSV は、在庫の取り込みやデータベースの一時テーブルなど、区切り付きテキストを受け付ける場所へ、印刷された記録を移すのに役立ちます。XLSX ブックと異なり、シートのタブ、色、数式は含みません。元のページごとに個別のワークシートを保ちたい場合は「PDFをExcelに変換」を、使用先が 1 つの連続したレコード列を期待する場合は CSV を使用してください。
旧式の PDF 一覧から一時的な取り込みファイルを準備します。繰り返しの見出しを取り除き、レコード数を確認し、確認済みデータを移す前に一時的な取り込みで対応付けを検証してください。
仕入先の PDF 一覧から明細項目を抽出して比較表を作ります。単位、数量、価格が別々のフィールドにあり、説明内の引用符が保持されていることを確認してください。
文字ベースの測定表を取り出し、データ整理の演習に使用します。書き出された生のセルを PDF と比較し、分析環境で検証済みの値を数値型に変換してください。
文字を選択できるPDFの表を選びます。
スクリーンショットを選択すると拡大できます。
ページ、区切り文字、行や列を推定する設定を選択します。
スクリーンショットを選択すると拡大できます。
CSVをダウンロードし、レコードを取り込む前に各フィールドを確認します。
スクリーンショットを選択すると拡大できます。
スクリーンショットは、機密情報を含まないサンプルファイルでこのツールキットを操作したものです。実際のファイル名、ページ数、設定は異なる場合があります。
最後の項目名は2行目に続いています。書き出したデータでは続きが別の行になるため、表計算のレコードとして使う前に確認が必要です。
元の表には3項目があり、合計は65.00です。1つの項目名が2行にまたがっています。

これらのセルはダウンロードしたファイルから読み取りました。最後の項目名の続きが独立した行になっています。

使用した設定: 1ページ目。上170 pt、下340 ptを除外。行の許容差3 pt、列の間隔18 pt。CSVはカンマ区切りです。
位置に基づく抽出では、結合されたレコードや数式を再構築しません。アラビア語のサンプルでは、位置揃えによって列も増えます。計算前に各行をPDFと照合してください。
確認日:。機密情報を含まない独自サンプルを、バージョン3.16.0でローカルのChromium上で処理しました。本番ホスティングの性能測定ではありません。
| 設定 | 想定される動作 |
|---|---|
| 対応する入力 | |
| 処理場所 | お使いのブラウザー |
| ファイル選択 | 入力ファイル 1 個 |
| 入力サイズ | 合計 100 MB。展開した画像とページにはピクセル数の上限もあります |
| ページの選択 | 1 回の処理で最大 200 ページを選択できます。「ページ」の空欄が全ページを意味するのは、PDF が 200 ページ以下の場合だけです。より長い文書には範囲を分けて使用してください。 |
画像だけの表には、書き出せる文字の行がありません。OCR で認識し、CSV を準備する前に数字と間隔を確認してください。
長いレポートを処理する前に、代表的な 1 ページを書き出します。見出しやフッターが余分なレコードになった場合は、除外する上または下の余白を増やしてください。この設定は PDF ポイントを使い、1 インチは 72 ポイントです。隣接するフィールドが結合される場合は列間隔のしきい値を下げ、説明が複数セルに分かれる場合は上げます。折り返された住所は複数の抽出行になることがあるため、最終設定を決める前にそのようなレコードを少なくとも 1 つ確認してください。
選択ページの行は、データベースのスキーマを再構築せずに結合されます。そのため、繰り返しの列見出しがレコードとして含まれる場合があり、空のセルだけではデータの欠落か意図的な空白かはわかりません。未編集の書き出しを保管し、手作業の整理を記録して、データセット全体を受け入れる前に小さな試験取り込みを行ってください。=、+、@、- で始まる値には、負の金額に見えるものを含め、保護用アポストロフィが付く場合があります。使用先が正確な文字列や数値を要求する場合は、意図的に処理してください。
| 状況 | 対処方法 |
|---|---|
| 説明が多数の列に分かれる | 間隔のしきい値を上げ、代表的なページで再試行してください。 |
| 取り込み後に ID の先頭のゼロが消える | 表計算またはデータベースのアプリケーションで、その列を文字列として取り込んでください。 |
| 複数の表の形が異なる | それぞれ別に変換し、データを結合する前に見出しと列順を照合してください。 |
明細に口座コード 00127 と金額 -45.50 が印刷されているとします。ゼロを保持するため、口座コードの列は文字列として取り込みます。書き出した金額の先頭に保護用アポストロフィが付いているか確認し、検証した値を使用先で意図的に変換してください。取引合計を明細と照合し、抽出の記録として元の CSV を保管します。
数式になり得る値にはアポストロフィを付けます。それでも、信頼できないデータはアプリケーションに取り込む前に確認してください。
はい。文書内の実際のページ番号を入力してください。範囲を絞ると無関係な行が減り、整理が簡単になります。
UTF-8、引用符付きのテキストフィールド、書き出し時と同じ区切り文字(コンマ、セミコロン、タブ)を使用します。取り込みプレビューで各値が想定した列に入ることを確認してください。先頭にゼロのある識別子は文字列として保ち、数式保護用のアポストロフィも考慮します。
書き出しでは、-、+、=、@ で始まる文字列など、数式として解釈され得る値の先頭を保護します。管理された取り込みで保護を外す前に、ソースと意図するデータ型を確認してください。識別子は文字列として保持します。
選択ページの行は、個別のシートタブや表の自動判別を行わず、1 ファイルに結合されます。列構造が異なる表は別々に書き出すか、ページごとに別のワークシートがあるほうが確認しやすい場合は「PDFをExcelに変換」を使用してください。
次のツールもご利用ください:PDFをExcelに変換, ExcelをPDFに変換, PDFをOCR処理.