Tabel PDF ke CSV

Tabel PDF ke CSV

Pilih PDF berbasis teks

Ubah tabel PDF sederhana yang berbasis teks menjadi berkas CSV atau TSV tanpa mengirim PDF ke server. Browser mengelompokkan fragmen teks menurut posisi tampilannya dan mencari posisi kolom yang berulang. Periksa setiap tabel sebelum mengunduh karena deteksi ini bersifat konservatif dan berupaya sebaik mungkin, bukan jaminan bahwa tata letak PDF yang rumit akan menjadi baris dan kolom yang sempurna.

Cara mengekstrak tabel PDF menjadi CSV

  1. 1

    Pilih PDF berbasis teks

    Pilih PDF hingga 20 MiB dan 150 halaman. Pindaian yang hanya berisi gambar halaman harus diproses dengan OCR terlebih dahulu.

  2. 2

    Biarkan browser mendeteksi tabel

    Ekstraktor memakai koordinat teks yang terlihat, termasuk rotasi halaman dan CropBox, lalu mencari pola baris dan kolom yang berulang.

  3. 3

    Tinjau dan atur hasil

    Pilih tabel yang diperlukan, periksa baris yang diberi sel kosong, lalu pilih koma, titik koma, atau tab, penanda UTF-8, dan perlindungan rumus.

  4. 4

    Unduh setiap tabel

    Setiap tabel pilihan menjadi unduhan CSV atau TSV lokal tersendiri. Tabel yang berlanjut ke halaman lain tidak digabungkan.

Yang dapat dan tidak dapat disimpulkan oleh detektor

PDF biasanya menyimpan fragmen teks pada koordinat, bukan kisi tabel dengan baris dan kolom bernama. Alat ini menggabungkan fragmen pada garis yang sama dan mempertahankan posisi kolom yang muncul berulang. Beberapa tabel teratur pada satu halaman dapat dipisahkan, sedangkan prosa satu kolom diabaikan bila polanya jelas.

Rotasi halaman dan CropBox yang bergeser ikut dihitung. Pada baris yang didominasi teks kanan-ke-kiri, urutan kolom mengikuti arah dari lapisan teks PDF. Namun, pemeriksaan tersebut tidak dapat membangun ulang semua tata letak.

Tata letak PDF Hasil yang mungkin Hal yang perlu diperiksa
Ekspor rapi dengan kolom berulang Biasanya paling baik Judul kolom, tanda desimal, dan sel kosong
Nilai hilang pada baris teratur Sel kosong ditambahkan pada kolom perkiraan Apakah kolom yang tepat tetap kosong
Sel gabungan atau teks terlipat Teks bisa terpisah, bergeser, atau menyatu Bandingkan pratinjau dengan PDF
Beberapa tabel teratur pada satu halaman Dapat terdeteksi secara terpisah Pilih hanya tabel yang dibutuhkan
Halaman berupa gambar pindaian Tidak ada tabel terdeteksi Jalankan OCR terlebih dahulu

Batas 20 MiB dan 150 halaman dilengkapi batas keamanan fragmen teks dan jumlah karakter: maksimal 100.000 fragmen atau 250.000 karakter per halaman, serta 1.000.000 fragmen atau 5.000.000 karakter per dokumen. Karena itu PDF yang sangat terfragmentasi dapat berhenti walau ukuran dan jumlah halamannya masih di bawah batas utama.

CSV, TSV, dan keamanan spreadsheet

Keluaran dapat memakai koma, titik koma, atau tab. Keluaran tab disimpan sebagai TSV. Baris memakai akhir baris CRLF. Kolom diapit tanda kutip ganda bila memuat pemisah aktif, tanda kutip ganda, carriage return, atau line feed; tanda kutip ganda di dalam nilai digandakan. Aturan ini mengikuti pola umum RFC 4180, yang disesuaikan dengan pemisah pilihan.

Perlindungan rumus aktif secara default. Jika sel diawali =, +, -, atau @ setelah spasi awal, termasuk bentuk lebar penuh yang didukung, alat menambahkan apostrof agar aplikasi spreadsheet lebih mungkin memperlakukannya sebagai teks. Tambahan itu mengubah nilai sel. Menonaktifkan perlindungan mempertahankan teks mentah, tetapi membuka konten mirip rumus dari PDF yang tidak tepercaya dapat berbahaya. Panduan CSV Injection OWASP menjelaskan mengapa tidak ada mitigasi yang berlaku untuk semua spreadsheet dan proses simpan ulang.

Penanda UTF-8 opsional membantu beberapa aplikasi mengenali teks non-Latin. Tetap periksa hasil sebelum dipakai untuk akuntansi, pelaporan, atau impor otomatis.

Data langkah yang privat

PDF, tabel hasil deteksi, dan pilihan Anda tetap di browser ini. Data disimpan dalam penyimpanan lokal browser yang dibatasi selama maksimal 30 menit agar alur tiga langkah dapat dilanjutkan. Semua unduhan dibuat lokal dan tidak ada yang diunggah oleh alat ini. Memulai ulang menghapus pekerjaan saat ini, sedangkan kebijakan penyimpanan atau mode privat browser dapat menghapusnya lebih cepat.

Pertanyaan yang Sering Diajukan

Tidak. Pembacaan PDF, deteksi tabel, serta pembuatan CSV atau TSV dilakukan di browser. Pekerjaan disimpan lokal selama maksimal 30 menit agar langkah dapat dilanjutkan, dan semua unduhan dibuat lokal.

Tidak jika PDF hanya berisi gambar halaman. Ekstraktor memerlukan lapisan teks PDF beserta posisinya. Jalankan OCR terlebih dahulu, lalu gunakan PDF berbasis teks hasilnya.

Pilih koma, titik koma, atau tab. Baris memakai CRLF. Nilai yang berisi pemisah terpilih, tanda kutip, carriage return, atau line feed akan diapit tanda kutip, dan tanda kutip di dalam nilai digandakan. Keluaran tab memakai ekstensi .tsv.

Apostrof ditambahkan ke sel yang terlihat seperti rumus spreadsheet, termasuk yang diawali =, +, -, atau @ setelah spasi awal. Perlindungan aktif secara default dan mengubah nilai tersebut. Matikan hanya jika teks mentah harus dipertahankan dan PDF dapat dipercaya.

Deteksi bergantung pada posisi teks yang berulang, bukan sel tabel asli. Teks terlipat, sel gabungan, jarak tidak biasa, arah campuran, dan tata letak dekoratif dapat memecah atau menggeser nilai. Rotasi serta CropBox dinormalisasi, tetapi pratinjau tetap harus dibandingkan dengan sumber.

Beberapa tabel teratur pada satu halaman dapat dideteksi dan dipilih satu per satu. Setiap tabel terpilih diunduh sebagai berkas tersendiri. Tabel yang berlanjut ke halaman berikutnya tidak digabungkan.

Alat Terkait