Konverter PDF ke HTML

Ubah ke HTML
Berikutnya

Konverter ini membaca teks PDF Anda dan membungkusnya dalam berkas HTML yang bersih dan minimal: satu <section> per halaman, judul halaman <h2>, dan paragraf <p>. Semuanya berjalan di browser Anda menggunakan PDF.js, jadi berkas tidak pernah diunggah. Hasilnya adalah HTML sederhana berisi teks saja yang bisa Anda buka, edit, atau tempel ke CMS lalu beri gaya dengan CSS Anda sendiri. Alat ini dibuat untuk memindahkan teks dari PDF ke web, bukan untuk mereproduksi halaman yang sudah didesain.

Cara mengonversi PDF ke HTML

  1. 1

    Pilih PDF Anda

    Seret PDF berbasis teks ke dalam kotak atau klik untuk menelusuri. Semuanya tetap berada di browser Anda.

  2. 2

    Konversi ke HTML

    PDF.js membaca setiap halaman dan mengekstrak teksnya, mengelompokkan baris menjadi paragraf.

  3. 3

    Tinjau HTML

    Markup yang dihasilkan muncul di kotak pratinjau agar Anda dapat memeriksa hasilnya.

  4. 4

    Unduh berkas

    Simpan satu berkas `.html` dengan satu bagian per halaman, siap untuk diedit atau diberi gaya ulang.

Seperti apa hasilnya

Konverter menghasilkan satu berkas HTML5 yang valid dengan struktur minimal:

Elemen Berasal dari
Kerangka <!DOCTYPE html> Pembungkus HTML5 standar dengan set karakter UTF-8
<title> Nama berkas PDF Anda
<section data-page> Satu blok per halaman PDF
<h2>Halaman N</h2> Judul yang menandai awal setiap halaman
<p> Baris teks yang dikelompokkan menjadi paragraf berdasarkan jarak vertikal

Yang tidak dilakukannya

Ini adalah alat ekstraksi teks, bukan mesin tata letak. Secara sengaja, hasilnya tidak menyertakan:

  • Gambar, logo, atau ilustrasi dari PDF.
  • Tabel, daftar berpoin, atau daftar bernomor sebagai <table>/<ul>/<ol> HTML.
  • Font, warna, kolom, atau posisi asli.
  • CSS atau gaya inline apa pun.

Anda mendapatkan kata-kata dalam urutan baca, dibungkus dalam paragraf semantik, dan tidak lebih dari itu. Tambahkan CSS Anda sendiri setelahnya.

Hasil terbaik

  • Gunakan PDF berbasis teks (PDF yang teksnya bisa Anda seleksi di pembaca). PDF hasil pindai atau yang hanya berupa gambar tidak memiliki lapisan teks; tidak ada OCR di sini, sehingga hasilnya akan kosong untuk halaman-halaman tersebut.
  • Jalankan berkas melalui prettier --parser html atau pemformat lain untuk merapikan spasi sebelum Anda commit.
  • Memindahkannya ke WordPress? Tempel HTML ke blok kode/HTML, bukan ke editor visual, yang akan membungkusnya ulang.

Bukan alat tata letak

Jangan berharap HTML terlihat seperti PDF. Web bersifat cair, sedangkan halaman PDF bersifat tetap. Gunakan alat ini saat Anda ingin konten berada di web, lalu beri gaya ulang dengan CSS milik situs Anda sendiri.

Pertanyaan yang Sering Diajukan

Tidak. Alat ini mengekstrak teks dan menaruhnya dalam paragraf sederhana. Font, warna, kolom, dan posisi tidak direproduksi. Beri gaya pada hasilnya dengan CSS Anda sendiri.

Tidak. Hanya teks yang diekstrak. Gambar, logo, dan ilustrasi tidak dipindahkan ke HTML.

Hanya jika PDF memiliki lapisan teks yang sebenarnya. Halaman hasil pindai atau foto berupa gambar tanpa teks yang bisa diseleksi, dan tidak ada OCR di sini, jadi halaman tersebut tidak menghasilkan teks.

Tidak. Seluruh konversi berjalan di browser Anda dengan PDF.js. PDF tidak pernah meninggalkan perangkat Anda, sehingga aman untuk dokumen rahasia.

Alat Terkait

Alat ini tersedia dalam bahasa lain