Similitud de Cadenas
Compare dos cadenas con algoritmos Levenshtein, Jaro-Winkler, Coseno, Jaccard, Hamming y Dice. Resultados instantáneos, 100% privado.
¿Qué es la similitud de cadenas?
La similitud de cadenas mide cuán parecidas son dos cadenas de texto. Se usa en correctores ortográficos, análisis de ADN, detección de plagio y deduplicación de datos.
¿Qué es la distancia de Levenshtein?
La distancia de Levenshtein (distancia de edición) mide el número mínimo de ediciones de un solo carácter — inserciones, eliminaciones o sustituciones — necesarias para transformar una cadena en otra. Por ejemplo, la distancia entre "cat" y "bat" es 1.
¿Qué es la similitud de Jaro-Winkler?
Jaro-Winkler otorga puntuaciones más altas a cadenas que comparten un prefijo común. Se usa ampliamente para comparar nombres, direcciones y registros en bases de datos con errores tipográficos.
¿Cómo funciona la similitud coseno?
La similitud coseno divide las cadenas en n-gramas de caracteres, los convierte en vectores y mide el coseno del ángulo entre ellos. Funciona bien para textos largos y se usa en recuperación de información.
¿Cuál es la diferencia entre similitud coseno y Jaccard?
La similitud coseno usa vectores de frecuencia de n-gramas y mide el ángulo entre ellos, mientras que Jaccard compara conjuntos de n-gramas usando la proporción de intersección sobre unión. Jaccard ignora duplicados; coseno no.
¿Qué es la distancia de Hamming?
La distancia de Hamming cuenta el número de posiciones donde los caracteres correspondientes difieren entre dos cadenas de igual longitud. Solo funciona con cadenas de la misma longitud.
¿Qué es el coeficiente de Sørensen-Dice?
El coeficiente de Sørensen-Dice mide la similitud basándose en el número de bigramas compartidos respecto al total de bigramas en ambas cadenas. Da más peso a los elementos comunes que Jaccard.
¿Qué algoritmo debo usar?
Para cadenas cortas con errores (nombres, códigos), use Levenshtein o Jaro-Winkler. Para textos largos, la similitud coseno es la mejor. Para comparación rápida por conjuntos, use Jaccard.
¿Qué es el análisis de n-gramas?
Un n-grama es una secuencia contigua de n caracteres de una cadena. Por ejemplo, los bigramas de "hello" son "he", "el", "ll", "lo". Los n-gramas son la base de muchos algoritmos de similitud.
¿Qué es la coincidencia difusa?
La coincidencia difusa encuentra cadenas que coinciden aproximadamente con un patrón, no exactamente. Se usa en motores de búsqueda, correctores ortográficos y limpieza de datos.
¿Se envían mis datos a un servidor?
No, todos los cálculos se realizan localmente en su navegador. Su texto nunca sale de su dispositivo. No hay procesamiento ni almacenamiento en el servidor.
¿Puedo comparar textos en diferentes idiomas?
Sí, los algoritmos funcionan con cualquier carácter Unicode. Sin embargo, los resultados pueden variar porque diferentes idiomas tienen diferentes estructuras de caracteres.