Similaritate șiruri
Comparați două șiruri cu algoritmii Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming și Dice. Rezultate instantanee, 100% confidențial.
Ce este similaritatea șirurilor?
Similaritatea șirurilor măsoară cât de apropiate sunt două șiruri de text. Este folosită în corectoare ortografice, analiza ADN, detectarea plagiatului și deduplicarea datelor.
Ce este distanța Levenshtein?
Distanța Levenshtein (distanța de editare) măsoară numărul minim de editări cu un singur caracter — inserări, ștergeri sau substituții — necesare pentru a transforma un șir în altul. De exemplu, distanța dintre "cat" și "bat" este 1.
Ce este similaritatea Jaro-Winkler?
Jaro-Winkler acordă scoruri mai mari șirurilor care împart un prefix comun. Este folosită frecvent pentru potrivirea numelor, adreselor și înregistrărilor în baze de date.
Cum funcționează similaritatea cosinus?
Similaritatea cosinus descompune șirurile în n-grame de caractere, le convertește în vectori și măsoară cosinusul unghiului dintre ei. Funcționează bine pentru texte mai lungi.
Care este diferența dintre similaritatea cosinus și Jaccard?
Similaritatea cosinus folosește vectori de frecvență n-gram și măsoară unghiul dintre ei, în timp ce Jaccard compară seturi de n-gram folosind raportul intersecție/uniune. Jaccard ignoră duplicatele; cosinus nu.
Ce este distanța Hamming?
Distanța Hamming numără pozițiile în care caracterele corespunzătoare diferă între două șiruri de lungime egală. Funcționează doar pe șiruri de aceeași lungime.
Ce este coeficientul Sørensen-Dice?
Coeficientul Sørensen-Dice măsoară similaritatea pe baza numărului de bigrame partajate raportat la totalul bigramelor din ambele șiruri. Acordă mai multă greutate elementelor comune decât Jaccard.
Ce algoritm ar trebui să folosesc?
Pentru șiruri scurte cu greșeli de tastare (nume, coduri) folosiți Levenshtein sau Jaro-Winkler. Pentru texte lungi, similaritatea cosinus este cea mai bună. Pentru compararea rapidă a seturilor folosiți Jaccard.
Ce este analiza n-gram?
Un n-gram este o secvență contiguă de n caractere dintr-un șir. De exemplu, bigramele lui "hello" sunt "he", "el", "ll", "lo". N-gramele sunt blocurile de construcție ale multor algoritmi de similaritate.
Ce este potrivirea fuzzy?
Potrivirea fuzzy găsește șiruri care se potrivesc aproximativ cu un model, nu exact. Este folosită în motoare de căutare, corectoare ortografice și curățarea datelor.
Datele mele sunt trimise către un server?
Nu, toate calculele se efectuează local în browserul dvs. Textul dvs. nu părăsește niciodată dispozitivul. Nu există procesare sau stocare pe server.
Pot compara texte în limbi diferite?
Da, algoritmii funcționează cu orice caractere Unicode. Totuși, rezultatele pot varia deoarece limpile diferite au structuri de caractere diferite.