Zeichenkettenähnlichkeit
Vergleichen Sie zwei Zeichenketten mit Levenshtein, Jaro-Winkler, Kosinus, Jaccard, Hamming und Dice. Sofortige Ergebnisse, 100% privat.
Was ist Zeichenkettenähnlichkeit?
Zeichenkettenähnlichkeit misst, wie ähnlich sich zwei Texte sind. Sie wird in Rechtschreibprüfungen, DNA-Analysen, Plagiatserkennung und Daten-Deduplizierung verwendet.
Was ist die Levenshtein-Distanz?
Die Levenshtein-Distanz (Bearbeitungsabstand) misst die minimale Anzahl einzelner Zeichenbearbeitungen — Einfügungen, Löschungen oder Ersetzungen — um eine Zeichenkette in eine andere umzuwandeln. Zum Beispiel ist der Abstand zwischen "cat" und "bat" gleich 1.
Was ist die Jaro-Winkler-Ähnlichkeit?
Jaro-Winkler vergibt höhere Punktzahlen an Zeichenketten, die ein gemeinsames Präfix teilen. Sie wird häufig zum Abgleichen von Namen, Adressen und Datensätzen in Datenbanken verwendet.
Wie funktioniert die Kosinus-Ähnlichkeit?
Die Kosinus-Ähnlichkeit zerlegt Zeichenketten in Zeichen-n-Gramme, wandelt sie in Vektoren um und misst den Kosinus des Winkels zwischen ihnen. Sie eignet sich gut für längere Texte.
Was ist der Unterschied zwischen Kosinus- und Jaccard-Ähnlichkeit?
Kosinus-Ähnlichkeit verwendet n-Gramm-Häufigkeitsvektoren und misst den Winkel zwischen ihnen, während Jaccard n-Gramm-Mengen mit dem Verhältnis von Schnittmenge zu Vereinigungsmenge vergleicht. Jaccard ignoriert Duplikate; Kosinus nicht.
Was ist die Hamming-Distanz?
Die Hamming-Distanz zählt die Anzahl der Positionen, an denen sich entsprechende Zeichen zwischen zwei gleich langen Zeichenketten unterscheiden. Sie funktioniert nur bei gleich langen Zeichenketten.
Was ist der Sørensen-Dice-Koeffizient?
Der Sørensen-Dice-Koeffizient misst die Ähnlichkeit basierend auf der Anzahl gemeinsamer Bigramme im Verhältnis zur Gesamtzahl der Bigramme beider Zeichenketten. Er gewichtet gemeinsame Elemente stärker als Jaccard.
Welchen Algorithmus sollte ich verwenden?
Für kurze Zeichenketten mit Tippfehlern (Namen, Codes) verwenden Sie Levenshtein oder Jaro-Winkler. Für längere Texte ist Kosinus-Ähnlichkeit am besten. Für schnellen mengenbasierten Vergleich verwenden Sie Jaccard.
Was ist eine n-Gramm-Analyse?
Ein n-Gramm ist eine zusammenhängende Folge von n Zeichen aus einer Zeichenkette. Zum Beispiel sind die Bigramme von "hello": "he", "el", "ll", "lo". n-Gramme sind die Grundlage vieler Ähnlichkeitsalgorithmen.
Was ist Fuzzy-Matching?
Fuzzy-Matching findet Zeichenketten, die annähernd — nicht exakt — mit einem Muster übereinstimmen. Es wird in Suchmaschinen, Rechtschreibprüfungen und Datenbereinigung verwendet.
Werden meine Daten an einen Server gesendet?
Nein, alle Berechnungen erfolgen lokal in Ihrem Browser. Ihr Text verlässt niemals Ihr Gerät. Es gibt keine serverseitige Verarbeitung oder Datenspeicherung.
Kann ich Texte in verschiedenen Sprachen vergleichen?
Ja, die Algorithmen funktionieren mit allen Unicode-Zeichen. Die Ergebnisse können jedoch variieren, da verschiedene Sprachen unterschiedliche Zeichenstrukturen haben.