PDF ke JSON

Ekspor teks yang dapat dipilih, geometri halaman, dan posisi teks sebagai JSON.

Pilih berkas PDF

Seret berkas Anda ke sini atau gunakan tombol di bawah.

Hingga 25 MB total · Berkas tetap di perangkat Anda

Daftar Isi10 Bagian

Apa yang dapat diekstrak dari PDF ke JSON?

Ubah lapisan teks PDF menjadi berkas JSON untuk diperiksa atau diproses lebih lanjut. Ekspor mencatat halaman yang dipilih, dimensinya, serta elemen teks yang dikembalikan pembaca PDF, termasuk posisi dan transformasinya.

PDF menyimpan instruksi untuk menampilkan halaman. Alat ini tidak menyimpulkan bidang faktur, menyusun ulang tabel, atau mengenali tingkat judul asli. Halaman pindaian memerlukan OCR sebelum kata-katanya dapat muncul dalam ekspor.

Fitur PDF ke JSON

Pemilihan halaman

Ekspor rentang tertentu sambil mempertahankan nomor halaman asli. Dengan begitu, sampel kecil lebih mudah diperiksa sebelum memproses dokumen yang panjang.

Teks beserta koordinat

Simpan elemen teks bersama geometri halaman dan informasi posisinya. Gunakan PDF asli untuk menafsirkan koordinat dan memeriksa hubungan visual antarelemen.

Hasil yang dapat dibaca mesin

Unduh JSON yang valid untuk pengurai atau alur pemeriksaan Anda sendiri. Teks yang diekspor di-escape sebagai data; alat ini tidak menjalankan isi dokumen.

Pemrosesan lokal

Baca PDF yang dipilih di peramban Anda. Dokumen tidak dikirim ke server konversi dan berkas asli tidak diubah.

Bagaimana cara mengubah teks PDF ke JSON?

  1. Pilih PDF tanpa enkripsi yang teksnya dapat dipilih dalam aplikasi pembaca.
  2. Masukkan nomor halaman seperti 1, 3-5, atau kosongkan Halaman untuk menyertakan semua halaman yang diizinkan.
  3. Mulai konversi dan unduh berkas JSON.
  4. Buka berkas dalam penampil atau penyunting JSON, lalu bandingkan frasa yang dikenal dengan halaman PDF terkait.
  5. Periksa koordinat, urutan baca, dan halaman kosong sebelum memakai data dalam aplikasi lain.

Pilih PDF

Pilih PDF yang berisi teks yang dapat dipilih.

Pilih tangkapan layar untuk memperbesarnya.
PDF ke JSON: memilih PDF contoh yang memiliki lapisan teks.

Pilih halaman

Atur rentang halaman dan tinjau batas ekstraksi.

Pilih tangkapan layar untuk memperbesarnya.
PDF ke JSON: pemilihan halaman dan pengaturan ekstraksi.

Unduh JSON

Simpan JSON dan bandingkan dengan halaman sumber.

Pilih tangkapan layar untuk memperbesarnya.
PDF ke JSON: mengunduh ekspor teks terstruktur yang selesai.

Tangkapan layar menampilkan alat ini dengan berkas contoh tanpa data sensitif. Nama berkas, jumlah halaman, dan pengaturan Anda mungkin berbeda.

Mengapa mengekspor teks PDF sebagai JSON?

JSON berguna ketika alur dokumen memerlukan teks sekaligus posisinya. Pengembang dapat meninjau mutu ekstraksi, menemukan label berulang, atau menyiapkan pemetaan terpisah. Tetapkan pemetaan itu secara jelas: nilai uang yang berdekatan belum tentu merupakan total faktur, dan urutan ekstraksi tidak selalu sesuai dengan urutan baca manusia.

Siapa yang dapat menggunakan ekspor ini?

Pengembang pengolahan dokumen

Periksa lapisan teks sebelum membuat pengurai dan simpan rujukan halaman untuk pelacakan kesalahan.

Tim pemeriksa data

Bandingkan nilai sampel dengan halaman sumber sebelum menerima aturan ekstraksi.

Pelajar dan peneliti

Pelajari cara teks yang terlihat direpresentasikan dalam dokumen dengan tata letak tetap.

Pengaturan dan pemeriksaan hasil

PengaturanHasil yang diharapkan
MasukanSatu PDF hingga 25 MiB, dengan maksimal 500 halaman sumber.
PilihanMaksimal 200 halaman terpilih; hingga 20.000 elemen teks per halaman, 100.000 per proses, dan dua juta karakter teks.
KeluaranJSON berisi teks hasil ekstraksi dan geometri; maksimal 64 MiB.
Halaman pindaianTanpa OCR otomatis, ekspor gambar, atau pengenalan bidang dokumen.

Periksa sampel kecil sebelum membuat pengurai

Untuk laporan dengan dua kolom, ekspor satu halaman terlebih dahulu. Temukan label yang dikenal dan bandingkan posisinya dengan nilai tercetak. Jika elemen kedua kolom saling berselang-seling, kelompokkan berdasarkan koordinat dalam kode Anda sendiri, bukan menganggap larik tersebut sudah menjadi tabel yang selesai.

Pemecahan masalah PDF ke JSON

SituasiYang perlu diperiksa
Tidak ditemukan teks yang dapat dipilihJalankan OCR pada halaman pindaian, lalu ekspor lapisan teks PDF yang dihasilkan.
Teks muncul dalam urutan yang tidak diharapkanBandingkan halaman dan posisi teks; urutan ekstraksi tidak menetapkan urutan baca.
Pilihan halaman yang besar ditolakPilih lebih sedikit halaman. Halaman padat dapat mencapai batas elemen teks sebelum batas halaman.

Pertanyaan umum

Apakah PDF ke JSON mengenali bidang faktur?

Tidak. Hasil berisi elemen teks dan geometri. Nama bidang, hubungan, dan validasi bisnis memerlukan proses pemetaan terpisah.

Apakah gambar dan tabel disertakan?

Gambar tidak diekspor. Teks di dalam tabel dapat diekstrak, tetapi hubungan baris dan kolom tidak disusun ulang.

Dapatkah saya membuat ulang PDF asli dari JSON ini?

Ekspor merupakan format untuk pemeriksaan, bukan representasi PDF lengkap. Simpan PDF asli untuk mempertahankan tampilan, gambar grafis, fon, dan fitur interaktif.

Alat terkait

JSON ke PDF, PDF ke XML, OCR PDF.