Stränglikhet
Jämför två strängar med Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming och Dice. Omedelbara resultat, 100% privat.
Vad är stränglikhet?
Stränglikhet mäter hur lika två textsträngar är varandra. Det används i stavningskontroll, DNA-analys, plagiatdetektering och dededuplicering av data.
Vad är Levenshtein-avstånd?
Levenshtein-avstånd (redigeringsavstånd) mäter det minsta antalet enstaka teckenredigeringar — infogningar, raderingar eller ersättningar — som behövs för att omvandla en sträng till en annan. Till exempel är avståndet mellan "cat" och "bat" lika med 1.
Vad är Jaro-Winkler-likhet?
Jaro-Winkler ger högre poäng till strängar som delar ett gemensamt prefix. Används ofta för att matcha namn, adresser och poster i databaser.
Hur fungerar cosinus-likhet?
Cosinus-likhet delar upp strängar i tecken-n-gram, omvandlar dem till vektorer och mäter cosinus av vinkeln mellan dem. Fungerar bra för längre texter.
Vad är skillnaden mellan cosinus- och Jaccard-likhet?
Cosinus-likhet använder n-gram-frekvensvektorer och mäter vinkeln mellan dem, medan Jaccard jämför n-gram-mängder med kvoten snittmängda/union. Jaccard ignorerar dubbletter; cosinus gör det inte.
Vad är Hamming-avstånd?
Hamming-avstånd räknar antalet positioner där motsvarande tecken skiljer sig mellan två lika långa strängar. Det fungerar bara med strängar av samma längd.
Vad är Sørensen-Dice-koefficienten?
Sørensen-Dice-koefficienten mäter likhet baserat på antalet delade bigram i förhållande till det totala antalet bigram i båda strängarna. Den ger mer vikt åt gemensamma element än Jaccard.
Vilken algoritm bör jag använda?
För korta strängar med stavfel (namn, koder), använd Levenshtein eller Jaro-Winkler. För längre texter är cosinus-likhet bäst. För snabb mängdjämförelse, använd Jaccard.
Vad är n-gram-analys?
Ett n-gram är en sammanhängande sekvens av n tecken från en sträng. Till exempel är bigrammen av "hello": "he", "el", "ll", "lo". N-gram är byggstenarna i många likhetsalgoritmer.
Vad är fuzzy matching?
Fuzzy matching hittar strängar som ungefär matchar ett mönster, inte exakt. Det används i sökmotorer, stavningskontroller och datarensning.
Skickas min data till en server?
Nej, alla beräkningar utförs lokalt i din webbläsare. Din text lämnar aldrig din enhet. Det finns ingen server-side bearbetning eller datalagring.
Kan jag jämföra texter på olika språk?
Ja, algoritmerna fungerar med alla Unicode-tecken. Däremot kan resultaten variera eftersom olika språk har olika teckenstrukturer.