Podobnost řetězců
Porovnejte dva řetězce algoritmy Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming a Dice. Okamžité výsledky, 100% soukromí.
Co je podobnost řetězců?
Podobnost řetězců měří, jak moc si jsou dva textové řetězce podobné. Používá se při kontrole pravopisu, analýze DNA, detekci plagiátů a deduplikaci dat.
Co je Levenshteinova vzdálenost?
Levenshteinova vzdálenost (editační vzdálenost) měří minimální počet úprav jednoho znaku — vložení, smazání nebo nahrazení — potřebných k převedení jednoho řetězce na druhý. Například vzdálenost mezi "cat" a "bat" je 1.
Co je podobnost Jaro-Winkler?
Jaro-Winkler dává vyšší skóre řetězcům, které sdílejí společný prefix. Běžně se používá pro párování jmen, adres a záznamů v databázích.
Jak funguje kosinusová podobnost?
Kosinusová podobnost rozděluje řetězce na znakové n-gramy, převádí je na vektory a měří kosinus úhlu mezi nimi. Funguje dobře pro delší texty.
Jaký je rozdíl mezi kosinusovou a Jaccardovou podobností?
Kosinusová podobnost používá vektory frekvencí n-gramů a měří úhel mezi nimi, zatímco Jaccard porovnává množiny n-gramů pomocí poměru průniku k sjednocení. Jaccard ignoruje duplikáty; kosinus ne.
Co je Hammingova vzdálenost?
Hammingova vzdálenost počítá počet pozic, na kterých se odpovídající si znaky liší mezi dvěma řetězci stejné délky. Funguje pouze pro řetězce stejné délky.
Co je Sørensen-Diceův koeficient?
Sørensen-Diceův koeficient měří podobnost na základě počtu sdílených bigramů v poměru k celkovému počtu bigramů v obou řetězcích. Dává větší váhu společným prvkům než Jaccard.
Který algoritmus bych měl použít?
Pro krátké řetězce s překlepy (jména, kódy) použijte Levenshtein nebo Jaro-Winkler. Pro delší texty je nejlepší kosinusová podobnost. Pro rychlé porovnání množin použijte Jaccard.
Co je n-gramová analýza?
N-gram je souvislá posloupnost n znaků z řetězce. Například bigramy slova "hello" jsou "he", "el", "ll", "lo". N-gramy jsou stavebními kameny mnoha algoritmů podobnosti.
Co je fuzzy porovnávání?
Fuzzy porovnávání hledá řetězce, které přibližně odpovídají vzoru, ne přesně. Používá se ve vyhledávačích, kontrole pravopisu a čištění dat.
Jsou moje data odesílána na server?
Ne, všechny výpočty se provádějí lokálně ve vašem prohlížeči. Váš text nikdy neopustí vaše zařízení. Neexistuje žádné zpracování ani ukládání na serveru.
Mohu porovnávat texty v různých jazycích?
Ano, algoritmy pracují s libovolnými znaky Unicode. Výsledky se však mohou lišit, protože různé jazyky mají různé struktury znaků.