Merkkijonon samankaltaisuus
Vertaa kahta merkkijonoa algoritmeilla Levenshtein, Jaro-Winkler, Kosini, Jaccard, Hamming ja Dice. Välittömät tulokset, 100% yksityinen.
Mikä on merkkijonon samankaltaisuus?
Merkkijonon samankaltaisuus mittaa, kuinka lähellä kaksi tekstijonoa toisiaan ovat. Sitä käytetään oikeinkirjoituksen tarkistuksessa, DNA-analyysissä, plagiointin tunnistuksessa ja tietojen deduplikaatiossa.
Mikä on Levenshtein-etäisyys?
Levenshtein-etäisyys (muokkausetäisyys) mittaa pienimmän yksittäisten merkkien muokkausten — lisäysten, poistojen tai korvausten — määrän, joka tarvitaan yhden merkkijonon muuttamiseksi toiseksi. Esimerkiksi etäisyys "cat" ja "bat" välillä on 1.
Mikä on Jaro-Winkler-samankaltaisuus?
Jaro-Winkler antaa korkeammat pisteet merkkijonoille, joilla on yhteinen etuliite. Sitä käytetään laajasti nimien, osoitteiden ja tietueiden täsmäytykseen tietokannoissa.
Miten kosini-samankaltaisuus toimii?
Kosini-samankaltaisuus jakaa merkkijonot merkki-n-grammeiksi, muuntaa ne vektoreiksi ja mittaa niiden välisen kulman kosinin. Toimii hyvin pidemmillä teksteillä.
Mikä on ero kosini- ja Jaccard-samankaltaisuuden välillä?
Kosini-samankaltaisuus käyttää n-grammivektoreita ja mittaa kulman niiden välillä, kun taas Jaccard vertaa n-grammijoukkoja leikkauksen ja unionin suhteella. Jaccard jättää huomiotta kaksoiskappaleet; kosini ei.
Mikä on Hamming-etäisyys?
Hamming-etäisyys laskee niiden kohtien määrän, joissa vastaavat merkit eroavat toisistaan kahden yhtä pitkän merkkijonon välillä. Toimii vain yhtä pitkillä merkkijonoilla.
Mikä on Sørensen-Dice-kerroin?
Sørensen-Dice-kerroin mittaa samankaltaisuutta yhteisten bigrammien määrän suhteessa molempien merkkijonojen bigrammien kokonaismäärään. Se antaa enemmän painoa yhteisille elementeille kuin Jaccard.
Mitä algoritmia minun pitäisi käyttää?
Lyhyille merkkijonoille, joissa on kirjoitusvirheitä (nimet, koodit), käytä Levenshteiniä tai Jaro-Winkleriä. Pitkille teksteille kosini-samankaltaisuus on paras. Nopeaan joukkovertailuun käytä Jaccardia.
Mikä on n-gram-analyysi?
N-grammi on n merkin yhtäjaksoinen jono merkkijonosta. Esimerkiksi "hello":n bigrammit ovat "he", "el", "ll", "lo". N-grammit ovat monien samankaltaisuusalgoritmien perusrakennuspalasia.
Mikä on sumea haku?
Sumea haku löytää merkkijonoja, jotka vastaavat likimääräisesti mallia, eivät tarkalleen. Sitä käytetään hakukoneissa, oikeinkirjoituksen tarkistuksessa ja tietojen puhdistuksessa.
Lähetetäänkö tietoni palvelimelle?
Ei, kaikki laskelmat suoritetaan paikallisesti selaimessasi. Tekstisi ei koskaan poistu laitteestasi. Palvelinpuolen käsittelyä tai tietojen tallennusta ei ole.
Voinko verrata eri kielillä kirjoitettuja tekstejä?
Kyllä, algoritmit toimivat millä tahansa Unicode-merkeillä. Tulokset voivat kuitenkin vaihdella, koska eri kielillä on erilaiset merkkirakenteet.