Pembanding Daftar Fuzzy

Menyelaraskan hasil ekspor CRM dengan tabel pelanggan faktur, atau memadukan nama penjual dari dua sistem ERP yang berbeda, hampir selalu mengalami kesulitan akibat perbedaan kecil, misalnya “Acme Corp.” dibandingkan dengan “ACME Corporation” atau “acme corp”. Dengan menempelkan kedua daftar tersebut dan menetapkan ambang kemiripan, alat akan merekomendasikan kandidat terbaik dari daftar B untuk setiap entri di daftar A, serta menandai entri yang kurang dari ambang tersebut untuk ditinjau secara manual.

Cara menyelaraskan dua daftar yang kacau

  1. 1

    Tempel Daftar A

    Satu entri per baris, nama pelanggan, kode produk, dan alamat jalan.

  2. 2

    Tempel Daftar B

    Kumpulan kandidat: Perbedaan huruf besar-kecil, spasi, dan salah ketik tidak menjadi masalah.

  3. 3

    Atur ambang batas

    Persentase kemiripan di atas nilai tersebut akan menghasilkan hasil pencocokan yang valid (70% merupakan nilai default yang masuk akal).

  4. 4

    Baca laporan tersebut

    Setiap item A dipasangkan dengan kandidat B terbaik beserta skor kepercayaan. Item yang nilainya di bawah ambang batas ditandai untuk ditinjau kembali.

Bagaimana kemiripan diukur

Alat ini menggunakan metode similar_text dari PHP (skor subsekuens bersama terpanjang) dan melaporkan hasilnya dalam bentuk persentase. Semakin tinggi nilai tersebut, semakin baik; kesesuaian sempurna berarti 100%.

Ambang batas Perilaku
≥ 95% Hampir identik, hanya perbedaan dalam huruf kapital atau spasi
80–94% Kesalahan ejaan, tanda baca yang hilang, sufiks yang terpotong
60–79% Perubahan urutan kata, singkatan versus bentuk lengkap
< 60% Kemungkinan besar bukan pasangan yang sesungguhnya, periksa secara manual

Tips

  • Normalisasi terlebih dahulu jika Anda mengetahui jenis gangguan umum: ubah ke huruf kecil, hapus tanda baca, dan ringkas spasi berlebih. Anda akan mendapatkan skor yang lebih akurat.
  • Hapus akhiran nama perusahaan (“Inc”, “Ltd”, “GmbH”) jika muncul secara tidak konsisten di satu daftar tetapi tidak di daftar lainnya.
  • Pisahkan alamat yang panjang, mencocokkan “jalan + kota” secara terpisah lebih efektif dibandingkan mencocokkan satu baris yang digabung menjadi satu.
  • Perhatikan pola satu-ke-banyak. Alat ini memilih pencocokan B terbaik untuk setiap entri A; namun, alat ini tidak mencegah satu entri B yang sama cocok dengan beberapa baris A.

Kapan harus menggunakan algoritma yang lebih ketat

Untuk proses deduplikasi skala besar, jarak Levenshtein atau metode Jaro–Winkler menunjukkan kinerja yang lebih unggul dibandingkan similar_text, terutama pada nama-nama di mana posisi karakter sangat penting. Jika pencocokan fuzzy digunakan dalam penagihan atau penggabungan data, lakukan pemeriksaan acak terhadap 20 pasangan data sebelum mempercayai hasilnya secara masif.

Pertanyaan yang Sering Diajukan

Angka 70% mampu mendeteksi sebagian besar pencocokan yang sah sekaligus menandai kasus-kasus yang tidak sesuai secara benar. Tingkatkan batasnya menjadi 85% jika daftar B bersih dan Anda tidak dapat membiarkan terjadi hasil positif palsu; turunkan ke 55% jika kedua daftar penuh dengan data yang tidak akurat dan Anda berencana meninjau seluruh hasil secara manual.

Ya, tetapi sebaiknya lakukan normalisasi terlebih dahulu: hapus spasi, tanda hubung, prefiks kode negara, serta penggunaan huruf kecil dalam alamat email. Metode pencocokan fuzzy pada nilai mentah dapat menghasilkan skor rendah untuk entri yang secara struktural identik.

Secara internal, alat ini mengubah kedua kata tersebut ke bentuk huruf kecil sebelum dibandingkan; oleh karena itu, “Apple” dan “apple” mendapatkan skor 100%.

Ya, pencocokan berjalan di sisi server, sehingga kedua daftar Anda dikirim ke alat untuk dibandingkan. Keduanya diproses di memori hanya untuk permintaan tunggal tersebut dan tidak disimpan atau dicatat setelahnya.

Alat Terkait

Alat ini tersedia dalam bahasa lain