Podobieństwo ciągów
Porównaj dwa ciągi algorytmami Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming i Dice. Natychmiastowe wyniki, 100% prywatnie.
Czym jest podobieństwo ciągów?
Podobieństwo ciągów mierzy, jak bardzo dwa teksty są do siebie podobne. Jest używane w sprawdzaniu pisowni, analizie DNA, wykrywaniu plagiatów i deduplikacji danych.
Czym jest odległość Levenshteina?
Odległość Levenshteina (odległość edycji) mierzy minimalną liczbę edycji pojedynczych znaków — wstawień, usunięć lub zastąpień — potrzebnych do przekształcenia jednego ciągu w drugi. Na przykład odległość między "cat" a "bat" wynosi 1.
Czym jest podobieństwo Jaro-Winklera?
Jaro-Winkler przyznaje wyższe wyniki ciągom mającym wspólny prefiks. Jest powszechnie stosowane do dopasowywania imion, adresów i rekordów w bazach danych.
Jak działa podobieństwo cosinusowe?
Podobieństwo cosinusowe dzieli ciągi na n-gramy znaków, przekształca je w wektory i mierzy cosinus kąta między nimi. Dobrze działa dla dłuższych tekstów.
Jaka jest różnica między podobieństwem cosinusowym a Jaccarda?
Podobieństwo cosinusowe używa wektorów częstotliwości n-gramów i mierzy kąt między nimi, podczas gdy Jaccard porównuje zbiory n-gramów za pomocą stosunku przecięcia do sumy. Jaccard ignoruje duplikaty; cosinus nie.
Czym jest odległość Hamminga?
Odległość Hamminga zlicza liczbę pozycji, na których odpowiadające sobie znaki różnią się między dwoma ciągami o tej samej długości. Działa tylko dla ciągów o jednakowej długości.
Czym jest współczynnik Sørensen-Dice?
Współczynnik Sørensen-Dice mierzy podobieństwo na podstawie liczby wspólnych bigramów w stosunku do całkowitej liczby bigramów w obu ciągach. Nadaje większą wagę wspólnym elementom niż Jaccard.
Którego algorytmu powinienem użyć?
Dla krótkich ciągów z literówkami (imiona, kody) użyj Levenshteina lub Jaro-Winklera. Dla długich tekstów podobieństwo cosinusowe jest najlepsze. Do szybkiego porównania zbiorów użyj Jaccarda.
Czym jest analiza n-gramów?
N-gram to ciągła sekwencja n znaków z ciągu. Na przykład bigramy słowa "hello" to "he", "el", "ll", "lo". N-gramy są podstawą wielu algorytmów podobieństwa.
Czym jest dopasowanie rozmyte?
Dopasowanie rozmyte znajduje ciągi, które w przybliżeniu pasują do wzorca, nie dokładnie. Jest używane w wyszukiwarkach, sprawdzaniu pisowni i czyszczeniu danych.
Czy moje dane są wysyłane na serwer?
Nie, wszystkie obliczenia wykonywane są lokalnie w przeglądarce. Twój tekst nigdy nie opuszcza urządzenia. Nie ma przetwarzania ani przechowywania po stronie serwera.
Czy mogę porównywać teksty w różnych językach?
Tak, algorytmy działają z dowolnymi znakami Unicode. Jednak wyniki mogą się różnić, ponieważ różne języki mają różne struktury znaków.