Kemiripan String
Bandingkan dua string dengan algoritma Levenshtein, Jaro-Winkler, Cosine, Jaccard, Hamming, dan Dice. Hasil instan, 100% privat.
Apa itu kemiripan string?
Kemiripan string mengukur seberapa dekat dua teks saling cocok. Digunakan dalam pemeriksaan ejaan, analisis DNA, deteksi plagiarisme, dan deduplikasi data.
Apa itu jarak Levenshtein?
Jarak Levenshtein (jarak edit) mengukur jumlah minimum edit satu karakter — sisipan, penghapusan, atau substitusi — yang diperlukan untuk mengubah satu string menjadi string lain. Misalnya, jarak antara "cat" dan "bat" adalah 1.
Apa itu kemiripan Jaro-Winkler?
Jaro-Winkler memberikan skor lebih tinggi untuk string yang berbagi awalan yang sama. Banyak digunakan untuk mencocokkan nama, alamat, dan catatan dalam database.
Bagaimana cara kerja kemiripan Cosine?
Kemiripan Cosine memecah string menjadi n-gram karakter, mengubahnya menjadi vektor, dan mengukur cosinus sudut di antara mereka. Cocok untuk teks yang lebih panjang.
Apa perbedaan antara kemiripan Cosine dan Jaccard?
Kemiripan Cosine menggunakan vektor frekuensi n-gram dan mengukur sudut di antaranya, sedangkan Jaccard membandingkan himpunan n-gram menggunakan rasio irisan terhadap gabungan. Jaccard mengabaikan duplikat; Cosine tidak.
Apa itu jarak Hamming?
Jarak Hamming menghitung jumlah posisi di mana karakter yang sesuai berbeda antara dua string dengan panjang yang sama. Hanya berfungsi pada string dengan panjang yang sama.
Apa itu koefisien Sørensen-Dice?
Koefisien Sørensen-Dice mengukur kemiripan berdasarkan jumlah bigram yang dibagi terhadap total bigram di kedua string. Memberikan bobot lebih besar pada elemen yang sama daripada Jaccard.
Algoritma mana yang harus saya gunakan?
Untuk string pendek dengan kesalahan ketik (nama, kode), gunakan Levenshtein atau Jaro-Winkler. Untuk teks panjang, kemiripan Cosine paling baik. Untuk perbandingan himpunan cepat, gunakan Jaccard.
Apa itu analisis n-gram?
N-gram adalah urutan kontinu n karakter dari sebuah string. Misalnya, bigram dari "hello" adalah "he", "el", "ll", "lo". N-gram adalah blok bangunan banyak algoritma kemiripan.
Apa itu pencocokan fuzzy?
Pencocokan fuzzy menemukan string yang kira-kira cocok dengan pola, bukan persis. Digunakan dalam mesin pencari, pemeriksaan ejaan, dan pembersihan data.
Apakah data saya dikirim ke server?
Tidak, semua perhitungan dilakukan secara lokal di browser Anda. Teks Anda tidak pernah meninggalkan perangkat Anda. Tidak ada pemrosesan atau penyimpanan di server.
Bisakah saya membandingkan teks dalam bahasa berbeda?
Ya, algoritma bekerja dengan karakter Unicode apa pun. Namun, hasil mungkin berbeda karena bahasa yang berbeda memiliki struktur karakter yang berbeda.