Similaridade de Strings
Compare duas strings com algoritmos Levenshtein, Jaro-Winkler, Cosseno, Jaccard, Hamming e Dice. Resultados instantâneos, 100% privado.
O que é similaridade de strings?
Similaridade de strings mede o quão próximas duas cadeias de texto estão. É usada em verificadores ortográficos, análise de DNA, detecção de plágio e deduplicação de dados.
O que é a distância de Levenshtein?
A distância de Levenshtein (distância de edição) mede o número mínimo de edições de um caractere — inserções, exclusões ou substituições — necessárias para transformar uma string em outra. Por exemplo, a distância entre "cat" e "bat" é 1.
O que é a similaridade de Jaro-Winkler?
Jaro-Winkler dá pontuações mais altas a strings que compartilham um prefixo comum. É amplamente usada para comparar nomes, endereços e registros em bancos de dados com erros de digitação.
Como funciona a similaridade cosseno?
A similaridade cosseno divide as strings em n-gramas de caracteres, converte-os em vetores e mede o cosseno do ângulo entre eles. Funciona bem para textos longos.
Qual a diferença entre similaridade cosseno e Jaccard?
A similaridade cosseno usa vetores de frequência de n-gramas e mede o ângulo entre eles, enquanto Jaccard compara conjuntos de n-gramas usando a proporção de interseção sobre união. Jaccard ignora duplicatas; cosseno não.
O que é a distância de Hamming?
A distância de Hamming conta o número de posições onde os caracteres correspondentes diferem entre duas strings de mesmo comprimento. Só funciona com strings de igual comprimento.
O que é o coeficiente de Sørensen-Dice?
O coeficiente de Sørensen-Dice mede a similaridade com base no número de bigramas compartilhados em relação ao total de bigramas em ambas as strings. Dá mais peso aos elementos comuns que Jaccard.
Qual algoritmo devo usar?
Para strings curtas com erros (nomes, códigos), use Levenshtein ou Jaro-Winkler. Para textos longos, a similaridade cosseno é a melhor. Para comparação rápida por conjuntos, use Jaccard.
O que é análise de n-gramas?
Um n-grama é uma sequência contígua de n caracteres de uma string. Por exemplo, os bigramas de "hello" são "he", "el", "ll", "lo". N-gramas são a base de muitos algoritmos de similaridade.
O que é correspondência difusa?
Correspondência difusa encontra strings que correspondem aproximadamente a um padrão, não exatamente. É usada em buscadores, corretores ortográficos e limpeza de dados.
Meus dados são enviados a um servidor?
Não, todos os cálculos são feitos localmente no seu navegador. Seu texto nunca sai do seu dispositivo. Não há processamento nem armazenamento no servidor.
Posso comparar textos em idiomas diferentes?
Sim, os algoritmos funcionam com qualquer caractere Unicode. No entanto, os resultados podem variar porque idiomas diferentes têm estruturas de caracteres diferentes.