Strenglighed
Sammenlign to strenge med Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming og Dice. Øjeblikkelige resultater, 100% privat.
Hvad er strenglighed?
Strenglighed måler, hvor to tekststrenge ligner hinanden. Det bruges i stavekontrol, DNA-analyse, plagiatdetektion og deduplikering af data.
Hvad er Levenshtein-afstand?
Levenshtein-afstand (redigeringsafstand) måler det mindste antal enkelttegnredigeringer — indsættelser, sletninger eller erstatninger — der kræves for at omdanne en streng til en anden. For eksempel er afstanden mellem "cat" og "bat" lig med 1.
Hvad er Jaro-Winkler-lighed?
Jaro-Winkler giver højere point til strenge, der deler et fælles præfiks. Bruges ofte til at matche navne, adresser og poster i databaser.
Hvordan fungerer cosinus-lighed?
Cosinus-lighed opdeler strenge i tegn-n-gram, konverterer dem til vektorer og måler cosinus af vinklen mellem dem. Fungerer godt til længere tekster.
Hvad er forskellen mellem cosinus- og Jaccard-lighed?
Cosinus-lighed bruger n-gram-frekvensvektorer og måler vinklen mellem dem, mens Jaccard sammenligner n-gram-mængder med forholdet fælles mængde/union. Jaccard ignorerer dubletter; cosinus gør det ikke.
Hvad er Hamming-afstand?
Hamming-afstand tæller antallet af positioner, hvor tilsvarende tegn er forskellige mellem to lige lange strenge. Det fungerer kun med strenge af samme længde.
Hvad er Sørensen-Dice-koefficienten?
Sørensen-Dice-koefficienten måler lighed baseret på antallet af delte bigrammer i forhold til det samlede antal bigrammer i begge strenge. Den giver mere vægt til fælles elementer end Jaccard.
Hvilken algoritme bør jeg bruge?
For korte strenge med tastefejl (navne, koder) brug Levenshtein eller Jaro-Winkler. For længere tekster er cosinus-lighed bedst. Til hurtig mængdesammenligning brug Jaccard.
Hvad er n-gram-analyse?
Et n-gram er en sammenhængende sekvens af n tegn fra en streng. For eksempel er bigrammerne af "hello": "he", "el", "ll", "lo". n-gram er byggestenene i mange lighedsalgoritmer.
Hvad er fuzzy matching?
Fuzzy matching finder strenge, der omtrent matcher et mønster, ikke præcist. Det bruges i søgemaskiner, stavekontrol og dataoprydning.
Bliver mine data sendt til en server?
Nej, alle beregninger udføres lokalt i din browser. Din tekst forlader aldrig din enhed. Der er ingen server-side behandling eller datalagring.
Kan jeg sammenligne tekster på forskellige sprog?
Ja, algoritmerne fungerer med alle Unicode-tegn. Resultaterne kan dog variere, fordi forskellige sprog har forskellige tegnstrukturer.