Penghapus Baris Duplikat

Ekspor CSV dengan baris berulang, file log dengan entri duplikat, daftar kata kunci dari tiga sumber yang saling tumpang tindih: setiap kali teks Anda berisi baris identik, penghapus ini menggabungkannya dan mempertahankan kemunculan pertama pada posisi aslinya. Dua opsi pencocokan, peka atau tidak terhadap huruf besar-kecil, pemotongan spasi opsional, dan jumlah baris yang dihapus.

Cara menghapus baris duplikat

  1. 1

    Tempel teksnya

    Tempel daftar, log, kolom CSV, atau teks apa pun yang setiap entrinya berada di barisnya sendiri.

  2. 2

    Pilih opsi pencocokan

    "Peka huruf besar-kecil" mempertahankan `Apple` dan `apple` sebagai baris terpisah; mematikannya akan menggabungkan keduanya. "Potong spasi" menghapus spasi di awal dan akhir sebelum dibandingkan.

  3. 3

    Hapus duplikat

    Klik tombolnya. Kemunculan pertama setiap baris dipertahankan dan pengulangan berikutnya dihapus.

  4. 4

    Periksa dan salin

    Statistik menunjukkan baris asli, baris unik, dan duplikat yang dihapus. Salin teks yang sudah bersih jika sudah sesuai.

Cara kerja pencocokan

Opsi Perilaku
Peka huruf besar-kecil (default) Apple dan apple dipertahankan sebagai baris terpisah
Tidak peka huruf besar-kecil Apple dan apple dihitung sebagai baris yang sama
Potong spasi (default) hello” dan “hello ” dianggap baris yang sama

Kemunculan pertama setiap baris dipertahankan, sehingga urutan asli teks tetap utuh.

Kasus penggunaan umum

  • Membersihkan CSV. Tempel satu kolom (nama, email, SKU) dan hapus pengulangan sebelum menyambungkannya kembali ke kolom lain.
  • Daftar URL. Gabungkan daftar URL hasil scraping yang memuat halaman yang sama berkali-kali.
  • Riset kata kunci. Menggabungkan ekspor kata kunci dari beberapa alat pasti menghasilkan duplikat.
  • Daftar email. Sebelum impor ke CRM, hapus duplikat persis untuk menghindari galat “sudah ada”.
  • Menyaring file log. Hilangkan baris peringatan yang berulang untuk melihat masalah yang unik.

Yang tidak dilakukan alat ini

  • Tanpa dedup berbasis kolom. CSV berisi email,name dengan email yang berulang tetapi nama berbeda akan mempertahankan kedua baris, karena seluruh barisnya berbeda. Untuk dedup berdasarkan satu kolom, ekstrak kolom itu dulu, hapus duplikatnya, lalu gunakan sebagai kunci untuk menyaring file asli.
  • Tanpa perlindungan baris kepala. Setiap baris diperlakukan sebagai data, sehingga baris kepala yang berulang ikut dihapus seperti baris lainnya.
  • Tanpa pencocokan mirip. Baris yang berbeda karena salah ketik, spasi di dalam, atau tanda baca tidak digabungkan.

Kiat

  • Normalisasi sebelum mencocokkan. Ubah ke huruf kecil dan hilangkan tanda baca di sekitarnya agar “Apple, “, “ apple “, dan “Apple” dihitung sebagai satu entri.
  • Simpan salinan teks asli sebelum pembersihan besar.
  • Periksa statistik. Jika Anda memperkirakan duplikat 10 persen tetapi 80 persen terhapus, ada yang salah dengan masukan.

Pertanyaan yang Sering Diajukan

Yang pertama. Urutan teks asli dipertahankan, jadi setiap baris unik tetap pada posisi aslinya.

Tidak otomatis. Setiap baris, termasuk kepala, dibandingkan seperti baris lain. Jika baris berikutnya sama dengan kepala, baris itu dihapus. Simpan kepala secara terpisah jika Anda membutuhkannya.

Penghapus ini fokus pada pencocokan persis demi kecepatan. Untuk pencocokan mirip (salah ketik, huruf besar-kecil berbeda, tanda baca tambahan), gunakan alat dedup khusus dengan ambang kemiripan.

Ya. Teks dikirim ke server kami agar alat dapat memprosesnya, dan hasilnya ditampilkan di halaman. Teks tidak disimpan setelahnya.

Alat Terkait

Alat ini tersedia dalam bahasa lain