Tekenreeksgelijkenis
Vergelijk twee tekenreeksen met Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming en Dice. Directe resultaten, 100% privé.
Wat is tekenreeksgelijkenis?
Tekenreeksgelijkenis meet hoe nauw twee tekstreeksen overeenkomen. Het wordt gebruikt in spellingscontroles, DNA-analyse, plagiaatdetectie en deduplicatie van gegevens.
Wat is de Levenshtein-afstand?
De Levenshtein-afstand (bewerkingsafstand) meet het minimale aantal bewerkingen van één teken — invoegingen, verwijderingen of vervangingen — dat nodig is om de ene tekenreeks in de andere te veranderen. Bijvoorbeeld, de afstand tussen "cat" en "bat" is 1.
Wat is Jaro-Winkler-gelijkenis?
Jaro-Winkler kent hogere scores toe aan tekenreeksen die een gemeenschappelijk voorvoegsel delen. Het wordt veel gebruikt voor het vergelijken van namen, adressen en records in databases.
Hoe werkt cosinus-gelijkenis?
Cosinus-gelijkenis splitst tekenreeksen op in karakter-n-grammen, zet ze om in vectoren en meet de cosinus van de hoek ertussen. Het werkt goed voor langere teksten.
Wat is het verschil tussen cosinus- en Jaccard-gelijkenis?
Cosinus-gelijkenis gebruikt n-gram frequentievectoren en meet de hoek ertussen, terwijl Jaccard n-gram verzamelingen vergelijkt met de verhouding van doorsnede tot vereniging. Jaccard negeert duplicaten; cosinus niet.
Wat is de Hamming-afstand?
De Hamming-afstand telt het aantal posities waar corresponderende tekens verschillen tussen twee even lange tekenreeksen. Het werkt alleen bij tekenreeksen van gelijke lengte.
Wat is de Sørensen-Dice-coëfficiënt?
De Sørensen-Dice-coëfficiënt meet gelijkenis op basis van het aantal gedeelde bigrammen ten opzichte van het totaal aantal bigrammen in beide tekenreeksen. Het geeft meer gewicht aan gemeenschappelijke elementen dan Jaccard.
Welk algoritme moet ik gebruiken?
Voor korte tekenreeksen met typefouten (namen, codes) gebruikt u Levenshtein of Jaro-Winkler. Voor lange teksten is cosinus-gelijkenis het beste. Voor snelle verzamelingvergelijking gebruikt u Jaccard.
Wat is n-gram-analyse?
Een n-gram is een opeenvolgende reeks van n tekens uit een tekenreeks. Bijvoorbeeld, de bigrammen van "hello" zijn "he", "el", "ll", "lo". N-grammen zijn de bouwstenen van veel gelijkenisalgoritmen.
Wat is fuzzy matching?
Fuzzy matching vindt tekenreeksen die bij benadering overeenkomen met een patroon, niet exact. Het wordt gebruikt in zoekmachines, spellingscontroles en gegevensschoonmaak.
Worden mijn gegevens naar een server gestuurd?
Nee, alle berekeningen worden lokaal in uw browser uitgevoerd. Uw tekst verlaat nooit uw apparaat. Er is geen server-side verwerking of opslag.
Kan ik teksten in verschillende talen vergelijken?
Ja, de algoritmen werken met elk Unicode-teken. De resultaten kunnen echter verschillen omdat verschillende talen verschillende tekenstructuren hebben.