Penghapus Baris Duplikat CSV

Data duplikat dapat masuk ke ekspor berformat CSV dengan cara yang mengganggu, seperti pengiriman data melalui webhook secara berulang, dua laporan yang disusun secara manual, atau operasi gabungan (join) yang menghasilkan baris-baris baru yang tidak diharapkan. Alat deduplikasi ini melakukan hashing terhadap setiap baris data dan hanya menyimpan versi pertama dari setiap baris, sehingga hasil ekspor tetap mempertahankan urutan baris asli sambil secara diam-diam menghilangkan salinan-salinannya. Baris header bersifat opsional; atur tombol pengaktifannya jika file Anda dimulai langsung dengan data.

Bagaimana cara kerja deduplikasi

  1. 1

    Tempel file CSV

    Sertakan atau kecualikan baris header; gunakan kotak centang untuk memberi tahu alat baris mana yang dimaksud.

  2. 2

    Setiap baris di-hash

    Baris-baris diparsing menjadi array, dan nilai MD5 dari representasi JSON-nya digunakan sebagai kunci keunikan.

  3. 3

    Kemunculan pertama yang menang

    Baris pertama dengan nilai hash tertentu akan dipertahankan, sedangkan baris-baris berikutnya yang memiliki isi sama akan diabaikan secara otomatis.

  4. 4

    Header dipertahankan

    Jika mode header aktif, baris ke-1 selalu diteruskan apa adanya tanpa dibandingkan untuk deduplikasi terhadap data.

Apa yang dianggap sebagai duplikat

Alat ini menggunakan kesetaraan seluruh baris. Dua baris dianggap duplikat jika setiap selnya cocok, posisi demi posisi, setelah penguraian CSV standar.

Hal-hal yang tetap dianggap berbeda

Baris A Baris B Diperlakukan sebagai
Alice,30,Paris Alice, 30, Paris Berbeda (ada spasi tambahan)
Bob,25 Bob,25, Berbeda (sel kosong di akhir)
"Jane Smith",42 Jane Smith,42 Sama (tanda kutip ditangani di tingkat parser)
TRUE,1 true,1 Berbeda (peka huruf besar-kecil)

Kapan deduplikasi pada tingkat kolom lebih tepat

Pencocokan seluruh baris bersifat ketat, dan biasanya itulah yang Anda inginkan, tetapi terkadang Anda benar-benar memerlukan “satu baris per email tanpa memperhatikan kolom lainnya”. Dalam kasus tersebut, pertama-tama gunakan Ekstraktor Kolom CSV untuk mengurangi file hanya menjadi kolom kunci, lakukan deduplikasi, kemudian gunakan hasilnya sebagai data pencarian. Atau gunakan perintah SQL seperti SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC; di PostgreSQL, atau GROUP BY yang dikombinasikan dengan agregat MIN() di lokasi lain.

Tips Praktis

  • Normalisasi terlebih dahulu sebelum melakukan deduplikasi. Pemangkas ruang kosong dan normalisasi huruf kapital-kecil pada kolom-kolom utama terlebih dahulu; jika tidak, baik ALICE@EXAMPLE.COM maupun alice@example.com akan tetap muncul.
  • Urutkan dulu, baru deduplikasi, agar hasilnya dapat diaudit. Jika Anda perlu tahu salinan mana yang dipertahankan, urutkan file CSV menurut kriteria pemecah seri pilihan Anda (stempel waktu terbaru, ID terendah) sebelum menjalankan alat ini.
  • Periksa jumlah baris. Gunakan alat Penghitung Baris CSV pada file asli dan file hasil untuk memastikan berapa banyak duplikat yang telah dihapus.

Pertanyaan yang Sering Diajukan

Tidak, alat ini melakukan hashing terhadap seluruh baris yang telah diproses secara lengkap. Untuk memastikan unikitas pada satu kolom saja, pertama-tama reduksi data CSV hanya ke kolom tersebut menggunakan Ekstraktor Kolom CSV, kemudian jalankan alat penghapus duplikat.

Ini adalah kemunculan pertama dalam berkas tersebut. Sebelumnya urutkan file CSV jika Anda ingin hasil yang diinginkan (misalnya rekaman terbaru atau dengan ID terendah).

Ya. Baris-baris diproses menggunakan aturan CSV standar, sehingga "Jane, Smith" tetap berupa satu sel dan dibandingkan secara langsung sebagai sel tersebut.

File CSV dikirim ke server kami untuk menghitung deduplikasi. File tersebut tidak disimpan atau dibagikan, dan tidak ditambahkan ke tautan halaman.

Alat Terkait

Alat ini tersedia dalam bahasa lain