Peringkas PDF

Langkah 1 dari 3

Membuka sesi peringkas privat...

Pilih PDF berbasis teks

Gunakan satu PDF hingga 20 MiB dan 150 halaman. Alat membaca lapisan teks yang ada; halaman pindaian memerlukan OCR terlebih dahulu.

atau letakkan satu PDF di sini

Memuat...

Dokumen besar dapat memerlukan waktu. Anda dapat berhenti dengan aman tanpa menyimpan hasil sebagian.

halaman

Alat ini membaca lapisan teks yang tertanam di PDF, memeringkat kalimat berdasarkan kata yang berulang, lalu menampilkan kalimat terpilih sesuai urutan hasil ekstraksi. Alat ini tidak memakai AI, tidak menulis ulang, dan tidak memeriksa fakta. Berkas serta teks hasil ekstraksi tetap berada di browser, sehingga hasilnya cocok sebagai tinjauan awal, bukan pengganti pembacaan sumber.

Cara meringkas PDF

  1. 1

    Pilih PDF berbasis teks

    Pilih satu PDF asli hingga 20 MiB dan 150 halaman. Dokumen pindaian atau berisi gambar saja perlu diproses dengan OCR terlebih dahulu.

  2. 2

    Ekstrak teks di browser

    Alat membaca teks tertanam secara lokal dan berhenti bila hasil ekstraksi melebihi 2.000.000 karakter. Berkas bersandi, rusak, atau tidak terbaca ditolak.

  3. 3

    Tentukan panjang ringkasan

    Pilih 3 hingga 20 kalimat. Jika dokumen lebih pendek, semua kalimat yang tersedia ditampilkan tanpa membuat teks tambahan.

  4. 4

    Tinjau dan salin

    Bandingkan kalimat serta kata yang sering muncul dengan PDF asli sebelum menyalin ringkasannya.

Apa yang sebenarnya dilakukan ringkasan ekstraktif?

Ringkasan ekstraktif mempertahankan kalimat dari sumber, bukan menyusun prosa baru. Alat menghitung kata yang berguna, memberi sedikit bobot tambahan pada kalimat awal, memilih kalimat dengan skor tertinggi, lalu mengembalikannya ke urutan hasil ekstraksi.

Contoh sederhana

Misalkan ringkasan proyek yang terdiri dari empat kalimat berbunyi:

  1. Proyek percontohan mengurangi rata-rata waktu tunggu layanan dukungan.
  2. Tim juga menyusun ulang buku panduan pelatihannya.
  3. Waktu tunggu kembali turun setelah peluncuran tahap kedua.
  4. Laporan menyarankan agar waktu tunggu dipantau setiap bulan.

Karena waktu tunggu muncul berulang kali, kalimat 1, 3, dan 4 dapat memperoleh peringkat lebih tinggi daripada kalimat 2. Jika panjang ringkasan diatur menjadi tiga kalimat, hasilnya mempertahankan kalimat tersebut dalam urutan 1, 3, 4. Alat tidak menulis kesimpulan baru atau menentukan apakah isi laporan benar.

Cara pemrosesan

Tahap Perilaku sebenarnya
Membaca PDF Membaca lapisan teks tertanam dengan PDF.js, tanpa OCR
Batas kalimat Menggunakan Intl.Segmenter sesuai bahasa halaman bila tersedia, dengan cadangan tanda baca Unicode
Batas kata Menggunakan segmentasi khusus bahasa bila tersedia dan menyaring daftar kecil kata umum
Pemeringkatan Menilai kalimat dari pengulangan kata dan sedikit bobot posisi awal
Keluaran Menjaga urutan ekstraksi kalimat terpilih dan menampilkan hingga 12 kata yang sering muncul

Batas penting

  • Kolom, tabel, header, footer, dan pengodean fon yang tidak biasa dapat menghasilkan urutan teks yang berbeda dari tata letak visual.
  • Bahasa halaman mengarahkan segmentasi; alat tidak mendeteksi bahasa seluruh dokumen secara otomatis.
  • Kalimat yang disalin persis dari sumber masih dapat kehilangan konteks paragraf atau tabel di sekitarnya.
  • Alat ini tidak memeriksa fakta, menyelesaikan pertentangan, atau menilai bukti.
  • Batasnya 20 MiB, 150 halaman, dan 2.000.000 karakter hasil ekstraksi.

Privasi dalam alur tiga langkah

PDF sumber dan teks hasil ekstraksi tetap berada dalam penyimpanan browser. ID acak di URL hanya menunjuk ke rekaman lokal, yang kedaluwarsa setelah 30 menit. Halaman dan pustaka PDF tetap mengambil aset biasa, tetapi permintaan tersebut tidak membawa PDF Anda, tidak mengirimkannya ke server kami, dan tidak meneruskannya ke layanan konversi.

Pertanyaan yang Sering Diajukan

Tidak. Alat memilih kalimat dari teks PDF dengan penilaian frekuensi kata yang deterministik. Alat tidak memparafrasakan sumber, membuat klaim baru, atau memeriksa fakta.

Tidak secara langsung. Dokumen yang hanya berisi gambar tidak memiliki lapisan teks. Jalankan OCR lebih dahulu, lalu gunakan PDF hasilnya yang dapat ditelusuri.

PDF menyimpan teks berdasarkan posisi, bukan sebagai paragraf biasa. Kolom, tabel, header, footer, dan fon yang tidak lazim dapat mengubah urutan hasil ekstraksi.

Browser diminta memisahkan kalimat dan kata sesuai bahasa halaman, termasuk bahasa yang tidak selalu memakai spasi. Ada cadangan tanda baca Unicode, tetapi bahasa PDF tidak dideteksi otomatis.

Gunakan satu PDF hingga 20 MiB, 150 halaman, dan 2.000.000 karakter hasil ekstraksi. Berkas bersandi, rusak, dan tidak terbaca ditolak.

Tidak. PDF dan teksnya tetap di browser. Dalam alur tiga langkah, rekaman lokal privat bertahan hingga 30 menit dan URL hanya memuat ID buramnya.

Alat Terkait