Similarité de Chaînes
Comparez deux chaînes avec les algorithmes Levenshtein, Jaro-Winkler, Cosinus, Jaccard, Hamming et Dice. Résultats instantanés, 100% confidentiel.
Qu'est-ce que la similarité de chaînes ?
La similarité de chaînes mesure à quel point deux textes se ressemblent. Elle est utilisée dans les correcteurs orthographiques, l'analyse ADN, la détection de plagiat et la déduplication de données.
Qu'est-ce que la distance de Levenshtein ?
La distance de Levenshtein (distance d'édition) mesure le nombre minimum de modifications d'un seul caractère — insertions, suppressions ou substitutions — nécessaires pour transformer une chaîne en une autre. Par exemple, la distance entre "cat" et "bat" est 1.
Qu'est-ce que la similarité de Jaro-Winkler ?
Jaro-Winkler attribue des scores plus élevés aux chaînes partageant un préfixe commun. Elle est largement utilisée pour comparer des noms, adresses et enregistrements dans les bases de données.
Comment fonctionne la similarité cosinus ?
La similarité cosinus décompose les chaînes en n-grammes de caractères, les convertit en vecteurs et mesure le cosinus de l'angle entre eux. Elle fonctionne bien pour les textes longs.
Quelle est la différence entre similarité cosinus et Jaccard ?
La similarité cosinus utilise des vecteurs de fréquence de n-grammes et mesure l'angle entre eux, tandis que Jaccard compare des ensembles de n-grammes avec le ratio intersection sur union. Jaccard ignore les doublons ; cosinus non.
Qu'est-ce que la distance de Hamming ?
La distance de Hamming compte le nombre de positions où les caractères correspondants diffèrent entre deux chaînes de même longueur. Elle ne fonctionne qu'avec des chaînes de longueur égale.
Qu'est-ce que le coefficient de Sørensen-Dice ?
Le coefficient de Sørensen-Dice mesure la similarité en fonction du nombre de bigrammes communs par rapport au total des bigrammes dans les deux chaînes. Il donne plus de poids aux éléments communs que Jaccard.
Quel algorithme dois-je utiliser ?
Pour des chaînes courtes avec des fautes (noms, codes), utilisez Levenshtein ou Jaro-Winkler. Pour des textes longs, la similarité cosinus est la meilleure. Pour une comparaison rapide par ensembles, utilisez Jaccard.
Qu'est-ce que l'analyse n-gramme ?
Un n-gramme est une séquence contiguë de n caractères d'une chaîne. Par exemple, les bigrammes de "hello" sont "he", "el", "ll", "lo". Les n-grammes sont la base de nombreux algorithmes de similarité.
Qu'est-ce que la correspondance floue ?
La correspondance floue trouve des chaînes qui correspondent approximativement à un modèle, pas exactement. Elle est utilisée dans les moteurs de recherche, les correcteurs orthographiques et le nettoyage de données.
Mes données sont-elles envoyées à un serveur ?
Non, tous les calculs sont effectués localement dans votre navigateur. Votre texte ne quitte jamais votre appareil. Il n'y a aucun traitement ni stockage côté serveur.
Puis-je comparer des textes dans différentes langues ?
Oui, les algorithmes fonctionnent avec n'importe quel caractère Unicode. Cependant, les résultats peuvent varier car différentes langues ont des structures de caractères différentes.