Strenglikhet
Sammenlign to strenger med Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming og Dice. Øyeblikkelige resultater, 100% privat.
Hva er strenglikhet?
Strenglikhet måler hvor like to tekststrenger er hverandre. Det brukes i stavekontroll, DNA-analyse, plagiatdeteksjon og deduplisering av data.
Hva er Levenshtein-avstand?
Levenshtein-avstand (redigeringsavstand) måler minimum antall enkelttegnredigeringer — innsettinger, slettinger eller erstatninger — som trengs for å forvandle en streng til en annen. For eksempel er avstanden mellom "cat" og "bat" lik 1.
Hva er Jaro-Winkler-likhet?
Jaro-Winkler gir høyere poeng til strenger som deler et felles prefiks. Brukes ofte for å matche navn, adresser og poster i databaser.
Hvordan fungerer cosinus-likhet?
Cosinus-likhet deler opp strenger i tegn-n-gram, konverterer dem til vektorer og måler cosinus av vinkelen mellom dem. Fungerer bra for lengre tekster.
Hva er forskjellen mellom cosinus- og Jaccard-likhet?
Cosinus-likhet bruker n-gram-frekvensvektorer og måler vinkelen mellom dem, mens Jaccard sammenligner n-gram-mengder med forholdet snitt/union. Jaccard ignorerer duplikater; cosinus gjør ikke det.
Hva er Hamming-avstand?
Hamming-avstand teller antall posisjoner der tilsvarende tegn er forskjellige mellom to like lange strenger. Det fungerer bare med strenger av samme lengde.
Hva er Sørensen-Dice-koeffisienten?
Sørensen-Dice-koeffisienten måler likhet basert på antall delte bigrammer i forhold til totalt antall bigrammer i begge strengene. Den gir mer vekt til felles elementer enn Jaccard.
Hvilken algoritme bør jeg bruke?
For korte strenger med skrivefeil (navn, koder), bruk Levenshtein eller Jaro-Winkler. For lengre tekster er cosinus-likhet best. For rask mengdesammenligning, bruk Jaccard.
Hva er n-gram-analyse?
Et n-gram er en sammenhengende sekvens av n tegn fra en streng. For eksempel er bigrammene av "hello": "he", "el", "ll", "lo". n-gram er byggesteinene i mange likhetsalgoritmer.
Hva er fuzzy matching?
Fuzzy matching finner strenger som omtrentlig samsvarer med et mønster, ikke nøyaktig. Det brukes i søkemotorer, stavekontroller og datarensing.
Blir dataene mine sendt til en server?
Nei, alle beregninger utføres lokalt i nettleseren din. Teksten din forlater aldri enheten din. Det er ingen server-side behandling eller datalagring.
Kan jeg sammenligne tekster på forskjellige språk?
Ja, algoritmene fungerer med alle Unicode-tegn. Resultatene kan imidlertid variere fordi forskjellige språk har forskjellige tegnstrukturer.