PDF ke XML

Ekstrak elemen teks PDF dan geometri halaman ke struktur XML yang terdokumentasi.

Pilih berkas PDF

Seret berkas Anda ke sini atau gunakan tombol di bawah.

Hingga 25 MB total · Berkas tetap di perangkat Anda

Daftar Isi10 Bagian

Apa yang terdapat dalam ekspor XML?

Ekspor lapisan teks PDF yang dapat dipilih sebagai XML. Berkas mengelompokkan elemen teks berdasarkan nomor halaman asli dan mencatat geometri halaman, arah teks, serta transformasi posisi. Hasilnya menyediakan data terstruktur untuk diperiksa dan diproses kemudian.

XML menjelaskan apa yang diekstrak oleh pembaca teks PDF. Hasil tersebut bukan XML asli yang mungkin digunakan untuk membuat dokumen dan tidak mengenali bidang faktur, menyusun ulang hubungan tabel, atau mengekspor gambar. Halaman yang hanya berisi gambar memerlukan OCR terlebih dahulu.

Fitur PDF ke XML

Elemen berdasarkan halaman

Pertahankan nomor halaman sumber, rotasi, dan batas area halaman yang terlihat bersama teks hasil ekstraksi. Ini mempertahankan rujukan yang berguna saat meninjau rentang terpilih.

Nilai teks yang di-escape

Karakter seperti ampersand dan tanda kurung sudut tetap menjadi data di dalam elemen XML. Teks yang menyerupai markah tidak dapat menjadi isi halaman yang dapat dieksekusi melalui ekspor ini.

Untai khusus yang dapat dipulihkan

Karakter yang tidak dapat direpresentasikan XML secara langsung menggunakan pengodean untai JSON dengan penanda eksplisit. Penanda itu memungkinkan program penerima memulihkan nilainya dengan tepat.

Pemrosesan di peramban

Buat berkas XML pada perangkat Anda. Sumber tidak diunggah untuk konversi maupun ditulis ulang.

Bagaimana cara mengekstrak XML dari PDF?

  1. Pilih PDF tanpa enkripsi yang berisi teks yang dapat dipilih.
  2. Masukkan nomor atau rentang halaman yang diperlukan pada Halaman.
  3. Konversikan berkas dan unduh hasil XML.
  4. Buka XML dalam penyunting teks atau aplikasi yang mendukung XML.
  5. Bandingkan halaman dan frasa yang dikenal sebelum memetakan elemen ke sistem lain.

Pilih PDF sumber

Pilih PDF dengan lapisan teks yang dapat dibaca.

Pilih tangkapan layar untuk memperbesarnya.
PDF ke XML: memilih PDF sumber.

Batasi rentang halaman

Pilih halaman yang diperlukan untuk ekstraksi XML.

Pilih tangkapan layar untuk memperbesarnya.
PDF ke XML: rentang halaman dan batas ekstraksi.

Simpan XML

Unduh XML dan periksa elemen halamannya.

Pilih tangkapan layar untuk memperbesarnya.
PDF ke XML: unduhan ekspor XML yang selesai.

Tangkapan layar menampilkan alat ini dengan berkas contoh tanpa data sensitif. Nama berkas, jumlah halaman, dan pengaturan Anda mungkin berbeda.

Mengapa menggunakan XML untuk memeriksa teks PDF?

Alur berbasis XML mungkin membutuhkan elemen halaman dan teks yang jelas sebelum menerapkan aturan transformasinya sendiri. Tim dapat memeriksa elemen tersebut, mempertahankan rujukan halaman sumber, dan membuat pemetaan terpisah untuk jenis dokumen yang dikenal. Pisahkan pemetaan dari ekstraksi: kedekatan satu elemen teks dengan elemen lain tidak dengan sendirinya menetapkan hubungan bisnis.

Siapa yang dapat memakai hasil XML ini?

Pengembang integrasi

Gunakan elemen halaman dan teks sebagai masukan untuk alur pemrosesan dokumen yang terkendali.

Pengelola arsip dokumen

Periksa apakah teks tetap tersedia bersama PDF asli yang disimpan.

Auditor data

Bandingkan nilai sampel hasil dengan halaman sumber sebelum menerima aturan transformasi.

Pengaturan dan pemeriksaan hasil

PengaturanHasil yang diharapkan
SumberSatu PDF hingga 25 MiB, dengan maksimal 500 halaman sumber.
Rentang halamanMaksimal 200 halaman terpilih. Rentang kosong hanya menyertakan semua halaman jika masih dalam batas tersebut.
Batas teksHingga 20.000 elemen per halaman, 100.000 per proses, dan dua juta karakter teks.
UnduhanDokumen XML hingga 64 MiB. Tidak ada DTD atau skema eksternal yang diambil.

Petakan label yang dikenal setelah memeriksa halaman

Untuk dokumen pengiriman, ekspor satu halaman dan temukan nomor rujukan yang dikenal. Periksa transformasi teksnya dan elemen di sekitarnya dengan halaman asli. Aplikasi Anda kemudian dapat menerapkan aturan untuk jenis dokumen tersebut. Hindari menganggap setiap angka yang berdekatan sebagai bidang yang sama pada tata letak yang tidak berkaitan.

Pemecahan masalah PDF ke XML

SituasiYang perlu diperiksa
XML tidak cocok dengan skema pemasokEkspor menggunakan struktur ekstraksinya sendiri. Buat pemetaan terpisah ke skema yang diharapkan sistem penerima.
Suatu elemen memiliki atribut encodingJika nilai encoding adalah json, uraikan teksnya sebagai untai JSON untuk memulihkan karakter yang tidak dapat ditulis langsung dalam XML.
Kata hilang atau urutannya tidak diharapkanPeriksa halaman pindaian atau penempatan teks yang tidak biasa. Terapkan OCR bila perlu dan tinjau koordinatnya.

Pertanyaan umum

Apakah PDF ke XML memulihkan XML sumber asli?

Tidak. PDF umumnya tidak menyimpan model data sumber. Ekspor ini mencatat lapisan teks dan geometri yang dapat diekstrak pembaca.

Apakah tag PDF diubah menjadi model dokumen XML?

Tidak. Alat tidak menyusun ulang semantik PDF bertag, judul, atau struktur tabel. Elemen halaman dan teksnya menjelaskan hasil ekstraksi.

Dapatkah saya mengubah XML ini kembali menjadi PDF yang sama?

Alat XML ke PDF dapat mencetak sumber XML, tetapi tidak dapat membangun ulang desain halaman asli dari berkas ekstraksi ini. Simpan PDF asli.

Alat terkait

XML ke PDF, PDF ke JSON, OCR PDF.