OCR PDF

Pilih PDF hasil pemindaian

Hanya PDF · 20 MB · 40 halaman

atau letakkan satu PDF di sini

Gunakan alat ini saat PDF berisi gambar halaman hasil pemindaian, bukan teks yang dapat dipilih. Alat akan merender halaman dan menjalankan pengenalan karakter optik (OCR) di browser, lalu menampilkan teks biasa yang dikenali untuk Anda periksa, salin, atau simpan sebagai file .txt. PDF sumber tetap berada di perangkat Anda. Alat ini tidak membuat PDF yang dapat ditelusuri dan tidak mempertahankan tata letak halaman. Hasil OCR juga dapat mengandung kesalahan.

Cara mengekstrak teks dari PDF hasil pemindaian

  1. 1

    Pilih bahasa dokumen

    Pilih bahasa utama pada teks tercetak. Pilihan ini menentukan model OCR yang digunakan browser.

  2. 2

    Buka PDF

    Pilih satu PDF berukuran hingga 20 MB dan maksimal 40 halaman. File sumber tetap di browser dan tidak dikirim ke server kami.

  3. 3

    Tunggu proses pengenalan

    Browser merender setiap halaman lalu membacanya dengan model OCR yang dipilih. File model mungkin perlu diunduh sebelum proses dimulai.

  4. 4

    Periksa hasilnya

    Bandingkan nama, angka, dan bagian penting dengan halaman asli. OCR membantu membaca dokumen, tetapi bukan transkripsi yang dapat langsung dipercaya untuk penggunaan penting.

  5. 5

    Salin atau unduh teks

    Salin menyimpan hasil di browser. Unduh TXT secara lokal menyimpan file teks biasa tanpa mengunggahnya. Pembuatan halaman unduhan terlindungi merupakan tindakan terpisah dan opsional.

Hasil yang dibuat

Hasilnya berupa teks biasa dengan penanda halaman sebelum teks yang dikenali dari setiap halaman. Alat ini tidak:

  • menambahkan lapisan teks tersembunyi ke PDF
  • menyusun ulang kolom, tabel, formulir, atau tipografi asli
  • mempertahankan tata letak visual halaman
  • menerjemahkan dokumen
  • memastikan bahwa teks hasil pengenalan sudah benar

Jika Anda memerlukan PDF yang tetap menampilkan halaman pindaian sekaligus memiliki teks yang dapat ditelusuri, gunakan aplikasi khusus untuk membuat PDF yang dapat ditelusuri atau perangkat lunak OCR desktop.

Dokumen yang paling mudah dikenali

OCR ditujukan untuk teks tercetak. Hasil pindaian yang lurus, tajam, dan memiliki kontras jelas lebih mudah dibaca daripada foto buram, faks pudar, atau halaman rusak. Huruf dekoratif, tulisan tangan, notasi matematika, kolom yang rapat, dan tabel yang rumit dapat menghasilkan teks yang keliru atau urutannya berantakan.

Alat menerima PDF hingga 20 MB dan 40 halaman. Pengenalan berjalan satu halaman pada satu waktu dan dapat menggunakan banyak memori, terutama untuk halaman berukuran besar atau beresolusi tinggi. Jika browser kehabisan memori, bagi PDF menjadi beberapa bagian yang lebih kecil dan proses secara terpisah.

Bahasa OCR yang didukung

Anda dapat memilih bahasa Inggris, Spanyol, Prancis, Jerman, Italia, Portugis, Belanda, Rusia, Jepang, Tionghoa Sederhana, Korea, atau Arab.

Pilih bahasa utama dokumen sebelum membuka file. Halaman yang mencampur beberapa bahasa atau sistem tulisan mungkin perlu diproses dalam beberapa kali percobaan. Hasilnya tetap dapat tertukar antara karakter yang bentuknya mirip.

Periksa teks yang dikenali

Selalu bandingkan hasilnya dengan PDF asli sebelum mengandalkannya. Perhatikan secara khusus:

  • nama, alamat, dan nomor identitas
  • tanggal, jumlah, tanda desimal, dan tanda minus
  • petunjuk hukum, medis, keuangan, atau keselamatan
  • pergantian halaman dan urutan baca pada dokumen multikolom

Jangan menganggap hasil OCR sebagai salinan resmi dari dokumen penting.

Penanganan file dan unduhan

PDF sumber dibaca secara lokal di browser. File itu tidak dimasukkan ke URL langkah alat dan tidak dikirim ke server kami. Browser mungkin mengunduh pustaka perender PDF, pustaka OCR, dan model bahasa yang dipilih dari penyedia pustaka yang telah dikonfigurasi.

Salin mempertahankan teks hasil pengenalan di browser dan menuliskannya ke papan klip. Unduh TXT secara lokal membuat file .txt turunan dan menyimpannya tanpa mengunggahnya. Jika Anda memilih Buat halaman unduhan, hanya file teks turunan tersebut yang diunggah untuk membuat tautan terlindungi dan dapat disimpan hingga 7 hari. Jika unggahan opsional gagal, unduhan lokal tetap tersedia.

Pertanyaan yang Sering Diajukan

Tidak. PDF sumber tetap di browser saat halaman dirender dan teks dikenali. Browser mungkin mengunduh pustaka perender PDF, pustaka OCR, dan model bahasa yang dipilih. Salin dan Unduh TXT secara lokal tidak mengunggah teks. Hanya tindakan Buat halaman unduhan yang mengunggah file teks biasa turunan.

Tidak. Hasilnya berupa teks biasa yang dikelompokkan per halaman. Alat tidak mengubah PDF asli, menambahkan lapisan teks tersembunyi, atau mempertahankan tata letaknya.

Bandingkan hasilnya dengan halaman asli. OCR dapat salah membaca karakter, melewatkan teks, atau mengubah urutan baca. Periksa setiap detail sebelum memakai hasil untuk urusan hukum, medis, keuangan, keselamatan, atau pekerjaan penting lainnya.

Alat ini dirancang untuk teks tercetak. Tulisan tangan, persamaan, dan huruf dekoratif dapat memberikan hasil yang tidak andal. Karakter di dalam tabel mungkin terbaca, tetapi susunan baris dan kolomnya tidak dipertahankan dalam teks biasa.

Bahasa Inggris, Spanyol, Prancis, Jerman, Italia, Portugis, Belanda, Rusia, Jepang, Tionghoa Sederhana, Korea, dan Arab. Pilih bahasa utama sebelum membuka PDF.

PDF dapat berukuran hingga 20 MB dengan maksimal 40 halaman. Halaman yang besar atau sangat terperinci tetap dapat melebihi memori browser, jadi membagi dokumen yang sulit menjadi beberapa file kecil dapat membantu.

Unduh TXT secara lokal membuat file .txt dari teks yang dikenali tanpa mengunggahnya. Jika Anda memilih Buat halaman unduhan, file turunan diunggah ke tautan terlindungi dan dapat disimpan hingga 7 hari. Unduhan lokal tetap tersedia jika unggahan opsional gagal.

Alat Terkait