Kesamaan Rentetan
Bandingkan dua rentetan dengan algoritma Levenshtein, Jaro-Winkler, Cosine, Jaccard, Hamming dan Dice. Hasil serta-merta, 100% peribadi.
Apakah kesamaan rentetan?
Kesamaan rentetan mengukur sejauh mana dua teks sepadan antara satu sama lain. Digunakan dalam semakan ejaan, analisis DNA, pengesanan plagiarisme dan deduplikasi data.
Apakah jarak Levenshtein?
Jarak Levenshtein (jarak edit) mengukur bilangan minimum edit satu aksara — sisipan, pemadaman atau penggantian — yang diperlukan untuk menukar satu rentetan kepada rentetan lain. Contohnya, jarak antara "cat" dan "bat" ialah 1.
Apakah kesamaan Jaro-Winkler?
Jaro-Winkler memberikan skor lebih tinggi kepada rentetan yang berkongsi awalan yang sama. Ia banyak digunakan untuk memadankan nama, alamat dan rekod dalam pangkalan data.
Bagaimanakah kesamaan Cosine berfungsi?
Kesamaan Cosine memecahkan rentetan kepada n-gram aksara, menukarnya kepada vektor dan mengukur kosinus sudut di antara mereka. Ia berfungsi dengan baik untuk teks yang lebih panjang.
Apakah perbezaan antara kesamaan Cosine dan Jaccard?
Kesamaan Cosine menggunakan vektor kekerapan n-gram dan mengukur sudut di antaranya, manakala Jaccard membandingkan set n-gram menggunakan nisbah persilangan kepada kesatuan. Jaccard mengabaikan duplikat; Cosine tidak.
Apakah jarak Hamming?
Jarak Hamming mengira bilangan kedudukan di mana aksara yang sepadan berbeza antara dua rentetan yang sama panjang. Ia hanya berfungsi pada rentetan yang sama panjang.
Apakah pekali Sørensen-Dice?
Pekali Sørensen-Dice mengukur kesamaan berdasarkan bilangan bigram yang dikongsi berbanding jumlah bigram dalam kedua-dua rentetan. Ia memberikan bobot lebih besar kepada elemen yang sama berbanding Jaccard.
Algoritma mana yang patut saya gunakan?
Untuk rentetan pendek dengan kesilapan taip (nama, kod), gunakan Levenshtein atau Jaro-Winkler. Untuk teks panjang, kesamaan Cosine adalah terbaik. Untuk perbandingan set pantas, gunakan Jaccard.
Apakah analisis n-gram?
N-gram ialah jujukan selanjar n aksara daripada rentetan. Contohnya, bigram bagi "hello" ialah "he", "el", "ll", "lo". N-gram ialah asas banyak algoritma kesamaan.
Apakah padanan fuzzy?
Padanan fuzzy mencari rentetan yang lebih kurang sepadan dengan corak, bukan tepat. Digunakan dalam enjin carian, semakan ejaan dan pembersihan data.
Adakah data saya dihantar ke pelayan?
Tidak, semua pengiraan dilakukan secara tempatan dalam pelayar anda. Teks anda tidak pernah meninggalkan peranti anda. Tiada pemprosesan atau storan di pelayan.
Bolehkah saya membandingkan teks dalam bahasa berbeza?
Ya, algoritma berfungsi dengan sebarang aksara Unicode. Walau bagaimanapun, hasil mungkin berbeza kerana bahasa yang berbeza mempunyai struktur aksara yang berbeza.