Konverter PDF ke Teks

Berikutnya: tinjau

Cara tercepat untuk mengambil kata-kata dari sebuah PDF. Alat ini membaca lapisan teks yang sudah tersimpan di dalam PDF, halaman demi halaman, dan memberi Anda teks polos yang bisa disalin atau disimpan sebagai berkas .txt. Semuanya berjalan di peramban Anda, jadi dokumen Anda tidak pernah diunggah. Satu hal yang perlu diketahui sejak awal: alat ini membaca teks yang sudah ada di dalam berkas, sehingga dokumen hasil pindaian atau foto (gambar tanpa lapisan teks) akan keluar kosong. Untuk kasus seperti itu, gunakan alat OCR sebagai gantinya.

Cara mengekstrak teks dari PDF

  1. 1

    Unggah PDF

    Seret ke sini atau klik untuk memilih. Berkas tetap di perangkat Anda dan tidak pernah dikirim ke server.

  2. 2

    Ekstrak teksnya

    Alat membaca lapisan teks setiap halaman dan menyatukannya, dengan penanda sebelum tiap halaman.

  3. 3

    Tinjau hasilnya

    Teks yang diekstrak muncul dalam kotak, halaman demi halaman, siap diperiksa.

  4. 4

    Salin atau unduh

    Salin ke papan klip atau simpan sebagai berkas .txt untuk dipakai di tempat lain.

Apa yang dibaca alat ini, dan apa yang tidak bisa

Jenis PDF Hasil
Diekspor dari Word, Google Docs, peramban, atau alat desain Teks lengkap, bersih, dan utuh
PDF digital dengan lapisan teks yang benar Teks diekstrak halaman demi halaman
Pindaian atau foto yang disimpan sebagai PDF (hanya gambar) Kosong atau nyaris kosong: tak ada teks untuk dibaca
PDF yang dilindungi kata sandi Tidak bisa dibaca sampai Anda membukanya lebih dulu

Tidak ada OCR di sini: pakai alat yang tepat untuk pindaian

Pengekstrak ini tidak menjalankan OCR (pengenalan karakter optis). Ia menyalin teks yang sudah ada di dalam PDF, ia tidak membaca piksel. Jika berkas Anda hasil pindaian dan tidak ada yang keluar, jalankan dulu melalui alat OCR, yang mengubah gambar menjadi lapisan teks sungguhan yang kemudian bisa Anda ekstrak.

Bagaimana teks ditata

Setiap halaman dipisahkan oleh penanda --- Page N ---, sehingga Anda bisa melihat di mana satu halaman berakhir dan berikutnya dimulai. Teks diambil sesuai urutan penyimpanannya di dalam PDF. Sebagian besar dokumen terbaca secara alami; beberapa dengan tata letak multikolom yang tidak lazim bisa menyisipkan kolom secara bergantian, karena alat mengikuti urutan tersimpan di PDF alih-alih menebak alur baca.

Kegunaan umum

  • Memberi masukan ke model AI. Model bahasa menerima teks polos, bukan PDF. Mengekstrak lebih dulu membuat semuanya lebih cepat dan mudah diprediksi.
  • Mengutip dan mencari. Salin sebuah bagian tanpa bertarung dengan pemilihan pada penampil PDF.
  • Memakai ulang konten. Pindahkan teks ke dokumen, email, atau catatan tanpa mengetik ulang.

Pertanyaan yang Sering Diajukan

Tidak. Ia membaca lapisan teks yang tertanam, dan pindaian hanyalah gambar tanpa lapisan teks, jadi hasilnya kosong. Gunakan alat OCR untuk dokumen pindaian atau foto, lalu ekstrak teksnya.

Tidak. Ekstraksi berjalan sepenuhnya di peramban Anda, pada perangkat Anda sendiri. PDF tidak pernah dikirim ke server dan tidak ada yang disimpan.

Beberapa PDF, terutama tata letak multikolom, menyimpan teksnya dalam urutan yang berbeda dari cara Anda membacanya. Alat mengikuti urutan tersimpan di PDF, sehingga kolom bisa bercampur. Dokumen yang diekspor dari pengolah kata hampir selalu keluar dengan benar.

Tidak selama masih terkunci. Hapus dulu kata sandinya dengan alat pembuka kunci PDF, lalu ekstrak teksnya.

Alat Terkait

Alat ini tersedia dalam bahasa lain