Satu Bagian per Halaman Sumber
HTML memberi label pada halaman sumber pilihan agar pembaca dapat kembali ke halaman PDF yang bersesuaian.
Buat dokumen HTML sederhana dari lapisan teks PDF.
Seret berkas Anda ke sini atau gunakan tombol di bawah.
Hingga 100 MB total · Berkas tetap di perangkat Anda
Lihat pratinjau dokumen di sini. Saat menambahkan isi, gunakan pratinjau sebagai panduan penempatan dan periksa berkas yang disimpan.
Ekspor teks PDF yang dapat dipilih ke dokumen HTML sederhana dengan satu bagian untuk setiap halaman pilihan. Hasilnya berguna sebagai referensi teks yang mudah dibaca atau titik awal pengeditan web.
Alat meng-escape karakter hasil ekstraksi dan tidak membuat ulang konten PDF interaktif atau CSS asli. Hasilnya adalah representasi teks, bukan versi situs web PDF dengan piksel yang sama persis.
HTML memberi label pada halaman sumber pilihan agar pembaca dapat kembali ke halaman PDF yang bersesuaian.
Karakter hasil ekstraksi di-escape untuk HTML. Teks PDF tidak dijalankan sebagai kode HTML tersemat.
Buat dokumen referensi yang lebih kecil dengan memilih hanya halaman yang relevan dengan tugas Anda.
Unduhan terbuka sebagai dokumen teks HTML. Unduhan tidak mereproduksi font, gambar, atau CSS halaman sumber.
HTML dapat memudahkan penayangan teks hasil ekstraksi dalam peramban atau penyerahannya kepada editor web. Konverter ini membuat bagian teks berlabel halaman, yang berguna sebagai referensi saat penerbit menyusun halaman web yang semestinya. Konverter tidak menyimpulkan judul semantik, membuat ulang tabel, atau menyediakan publikasi lengkap yang aksesibel. Setelah konversi, susun ulang konten menjadi judul dan paragraf bermakna, verifikasi urutan baca, dan tambahkan gambar yang diizinkan secara terpisah. Gunakan render halaman jika yang diperlukan adalah pratinjau visual tetap.
Pulihkan teks brosur yang disetujui untuk draf halaman web. Ganti bagian halaman umum dengan judul bermakna dan pastikan pemisah baris tidak memecah kalimat.
Buat referensi yang dapat dibaca peramban dari prosedur PDF yang mengutamakan teks. Pertahankan referensi halaman sumber sambil menyiapkan artikel yang ditinjau untuk sistem tim.
Bandingkan tata letak PDF tetap dengan representasi teks HTML sederhana. Kenali struktur, deskripsi gambar, dan markah tabel yang harus diberikan secara manual untuk edisi web yang dapat digunakan.
Pilih PDF berbasis teks untuk ekstraksi HTML.
Pilih tangkapan layar untuk memperbesarnya.
Atur halaman sumber dan nama unduhan opsional.
Pilih tangkapan layar untuk memperbesarnya.
Unduh HTML dan periksa bagian teksnya yang berlabel halaman.
Pilih tangkapan layar untuk memperbesarnya.
Tangkapan layar menampilkan alat ini dengan berkas contoh tanpa data sensitif. Nama berkas, jumlah halaman, dan pengaturan Anda mungkin berbeda.
| Pengaturan | Yang perlu diketahui |
|---|---|
| Masukan yang diterima | |
| Lokasi pemrosesan | Peramban Anda |
| Pemilihan berkas | Satu berkas masukan |
| Ukuran masukan | Total 100 MB; gambar dan halaman yang didekode juga memiliki batas piksel |
| Pemilihan halaman | Hingga 200 halaman pilihan per pekerjaan. Halaman kosong berarti semua halaman hanya ketika PDF memiliki 200 halaman atau kurang; gunakan rentang terpisah untuk dokumen lebih panjang. |
Ekspor ini memerlukan lapisan teks yang sudah ada. Halaman hasil pindai memerlukan OCR yang diperiksa sebelum teksnya dapat muncul dalam HTML yang dihasilkan.
Batas halaman tercetak jarang menunjukkan satu bagian web yang lengkap. Saat mengedit ekspor, tempatkan paragraf di bawah judul yang menjelaskan topiknya, berikan markah baris dan kolom yang semestinya pada tabel sebenarnya, serta sediakan teks penjelas untuk diagram penting. Teks berformat awal yang dihasilkan merupakan referensi untuk diedit, bukan bukti bahwa dokumen asli kini menjadi halaman web final. Periksa teks terhadap PDF sebelum menghapus label halaman sumber.
| Situasi | Tindakan yang perlu dilakukan |
|---|---|
| Desain halaman hilang | Ini merupakan ekspor teks ke HTML dari PDF, bukan rekonstruksi tata letak visual. |
| Halaman hasil pindai tidak memiliki konten | Tambahkan dan verifikasi lapisan teks OCR terlebih dahulu. |
| Karakter menyerupai kode HTML | Karakter sengaja di-escape agar konten dokumen hasil ekstraksi tidak dijalankan. |
Judul tercetak seperti “Rencana proyek” dapat muncul di dalam teks pre hasil ekspor. Setelah memastikan bahwa itu judul dokumen, editor dapat menandainya sebagai <h1>Rencana proyek</h1> dan menempatkan paragraf berikutnya dalam elemen p. Tentukan struktur dari makna teks, bukan sekadar akhir halaman PDF.
Ekspor ini menyertakan teks hasil ekstraksi yang di-escape. Gambar, tautan aktif, dan gaya halaman asli tidak dibuat ulang.
Tinjau konten, aksesibilitas, dan pemformatannya terlebih dahulu. Tambahkan tata letak web yang sesuai, alih-alih menganggap teks hasil ekstraksi sebagai situs lengkap.
Ya. Buka berkas unduhan dalam editor teks atau HTML. Tinjau karakter hasil ekstraksi dan tambahkan struktur yang sesuai sebelum menggunakannya dalam halaman yang diterbitkan.
Lanjutkan dengan HTML ke PDF, OCR PDF, PDF ke Teks.