Karakterlánc-hasonlóság
Hasonlítsa össze két karakterláncot Levenshtein, Jaro-Winkler, Koszinusz, Jaccard, Hamming és Dice algoritmusokkal. Azonnali eredmény, 100% privát.
Mi a karakterlánc-hasonlóság?
A karakterlánc-hasonlóság azt méri, mennyire egyezik két szöveges karakterlánc. Használják helyesírás-ellenőrzésben, DNS-elemzésben, plágiumfelismerésben és adatdeduplikációban.
Mi a Levenshtein-távolság?
A Levenshtein-távolság (szerkesztési távolság) a minimális egykarakteres szerkesztések — beszúrás, törlés vagy csere — számát méri, amelyek egy karakterlánc egy másikká alakításához szükségesek. Például a "cat" és "bat" közötti távolság 1.
Mi a Jaro-Winkler-hasonlóság?
A Jaro-Winkler magasabb pontszámot ad az közös prefixszel rendelkező karakterláncoknak. Gyakran használják nevek, címek és rekordok illesztésére adatbázisokban.
Hogyan működik a koszinusz-hasonlóság?
A koszinusz-hasonlóság a karakterláncokat karakter n-grammokra bontja, vektorokká alakítja, és méri a köztük lévő szög koszinuszát. Hosszabb szövegeknél működik jól.
Mi a különbség a koszinusz- és Jaccard-hasonlóság között?
A koszinusz-hasonlóság n-gramm gyakoriságvektorokat használ és a köztük lévő szöget méri, míg a Jaccard n-gramm halmazokat hasonlít össze a metszet/unión aránnyal. A Jaccard figyelmen kívül hagyja a duplikátumokat; a koszinusz nem.
Mi a Hamming-távolság?
A Hamming-távolság azon pozíciók számát számolja, ahol a megfelelő karakterek különböznek két egyforma hosszú karakterlánc között. Csak egyforma hosszú karakterláncokon működik.
Mi a Sørensen-Dice-együttható?
A Sørensen-Dice-együttható a megosztott bigrammok számának és a mindkét karakterláncban lévő összes bigramm arányának alapján méri a hasonlóságot. Nagyobb súlyt ad a közös elemeknek, mint a Jaccard.
Melyik algoritmust használjam?
Rövid, elíráseket tartalmazó karakterláncokhoz (nevek, kódok) használja a Levenshtein-t vagy Jaro-Winkler-t. Hosszú szövegekhez a koszinusz-hasonlóság a legjobb. Gyors halmaz-összehasonlításhoz használja a Jaccard-ot.
Mi az n-gram elemzés?
Az n-gram egy karakterláncból vett n karakter folytonos sorozata. Például a "hello" bigrammjai: "he", "el", "ll", "lo". Az n-grammok sok hasonlósági algoritmus építőkövei.
Mi a fuzzy matching?
A fuzzy matching olyan karakterláncokat talál, amelyek közelítőleg egyeznek egy mintával, nem pontosan. Keresőmotorokban, helyesírás-ellenőrzésben és adattisztításban használják.
Elküldik az adataimat egy szerverre?
Nem, minden számítás helyileg történik a böngészőjében. A szövege soha nem hagyja el az eszközét. Nincs szerveroldali feldolgozás vagy adattárolás.
Összehasonlíthatok különböző nyelvű szövegeket?
Igen, az algoritmusok bármilyen Unicode karakterrel működnek. Az eredmények azonban eltérhetnek, mert a különböző nyelvek karakterstruktúrája eltérő.