Skalar teks dengan tanda kutip
Pertahankan kata seperti yes, tanggal, tanda baca, dan frasa bertitik dua sebagai nilai untai. Teks hasil ekstraksi tidak menjadi instruksi YAML atau tag objek khusus.
Ekspor elemen teks PDF dan posisi halamannya sebagai data YAML.
Seret berkas Anda ke sini atau gunakan tombol di bawah.
Hingga 25 MB total · Berkas tetap di perangkat Anda
Lihat pratinjau dokumen di sini. Saat menambahkan isi, gunakan pratinjau sebagai panduan penempatan dan periksa berkas yang disimpan.
Buat berkas YAML yang berisi elemen teks hasil ekstraksi dari halaman PDF terpilih. Hasil mencakup rujukan halaman sumber, geometri halaman, dan transformasi posisi teks sehingga dapat diperiksa dalam penyunting teks atau alur pemrosesan terpisah.
Ekspor tidak menafsirkan dokumen sebagai konfigurasi aplikasi. Alat tidak menyimpulkan tingkat judul, mengekstrak gambar, mengenali bidang faktur, atau menyusun ulang tabel dari tampilannya. Teks mengikuti urutan ekstraksi pembaca PDF yang dapat berbeda dari urutan baca.
Pertahankan kata seperti yes, tanggal, tanda baca, dan frasa bertitik dua sebagai nilai untai. Teks hasil ekstraksi tidak menjadi instruksi YAML atau tag objek khusus.
Halaman yang dipilih mempertahankan nomor sumbernya. Pemeriksa dapat kembali ke halaman PDF terkait tanpa menghitung posisi larik keluaran.
Simpan transformasi dan arah teks serta dimensi halaman bersama kata-katanya. Proses berikutnya dapat meninjau posisi tanpa menganggap tabel sudah tersusun.
Keluaran menyatakan bahwa rekonstruksi semantik dan OCR tidak dilakukan. Ini membantu program lain memperlakukan hasil sebagai data ekstraksi.
Pilih PDF yang memuat teks yang perlu diperiksa.
Pilih tangkapan layar untuk memperbesarnya.
Mulailah dengan sejumlah kecil halaman sumber.
Pilih tangkapan layar untuk memperbesarnya.
Simpan hasil dan periksa nilai teksnya yang berkutip.
Pilih tangkapan layar untuk memperbesarnya.
Tangkapan layar menampilkan alat ini dengan berkas contoh tanpa data sensitif. Nama berkas, jumlah halaman, dan pengaturan Anda mungkin berbeda.
YAML dapat memudahkan peninjauan berbasis teks ketika tim membutuhkan informasi halaman terstruktur tanpa penampil terpisah. Gunakan ekspor sebagai data dokumen dan lakukan validasi sendiri sebelum mengimpornya. Laporan PDF tidak boleh langsung menjadi konfigurasi tepercaya hanya karena kata-katanya disimpan dalam berkas YAML.
Periksa teks dan rujukan halaman sebelum merancang aturan ekstraksi untuk tata letak dokumen yang dikenal.
Simpan catatan perantara yang mudah dibaca saat memeriksa kutipan terpilih dan lokasi halamannya.
Bandingkan perubahan data dokumen hasil ekstraksi menggunakan alat yang menangani berkas teks terstruktur.
| Pengaturan | Hasil yang diharapkan |
|---|---|
| Berkas masukan | Satu PDF hingga 25 MiB dan 500 halaman sumber. |
| Halaman terpilih | Maksimal 200 halaman sesuai urutan yang dimasukkan; rujukan halaman berulang hanya muncul sekali. |
| Batas ekstraksi | 20.000 elemen per halaman, 100.000 per proses, dan dua juta karakter teks. |
| Keluaran YAML | YAML 1.2 yang dinyatakan secara eksplisit dengan nilai untai berkutip; ukuran unduhan maksimal 64 MiB. |
Formulir dapat memuat kata tercetak yes di sebelah label dan angka dengan nol di awal. Periksa untai hasil ekstraksi tersebut dalam YAML dan bandingkan dengan sumber. Ekspor mempertahankan teks sebagai nilai berkutip sehingga aplikasi Anda dapat menentukan apakah suatu nilai merupakan label, pengenal, tanggal, atau hal lain.
| Situasi | Yang perlu diperiksa |
|---|---|
| Teks berisi rangkaian escape Unicode | Pengurai YAML dapat memulihkan karakter asli dari escape di dalam tanda kutip. Ini juga mencegah karakter kontrol mengganggu struktur berkas. |
| Hasil bukan konfigurasi yang siap diimpor | Hasil merupakan catatan ekstraksi. Petakan dan validasi bidang yang diperlukan aplikasi secara terpisah. |
| Pilihan halaman terlalu padat | Kurangi rentang halaman. Halaman padat dapat mencapai batas elemen teks atau karakter sebelum batas halaman. |
Tidak. Alat membaca PDF dan membuat keluaran YAML. Alat tidak memuat YAML yang diunggah, menjalankan tag, atau menerapkan pengaturan konfigurasi.
Tidak ada OCR otomatis. Jalankan OCR terlebih dahulu pada PDF yang hanya berisi gambar, lalu periksa teks yang dikenali sebelum mengekspornya.
Belum tentu. Halaman berkolom banyak dan label dengan posisi khusus dapat menghasilkan urutan ekstraksi berbeda. Periksa koordinatnya dan halaman asli.