Сходство строк
Сравните две строки алгоритмами Левенштейна, Джаро-Винклера, Косинуса, Жаккара, Хэмминга и Дайса. Мгновенный результат, 100% конфиденциально.
Что такое сходство строк?
Сходство строк измеряет, насколько две текстовые строки совпадают. Используется в проверке орфографии, анализе ДНК, обнаружении плагиата и дедупликации данных.
Что такое расстояние Левенштейна?
Расстояние Левенштейна (расстояние редактирования) измеряет минимальное количество односимвольных правок — вставок, удалений или замен — необходимых для преобразования одной строки в другую. Например, расстояние между "cat" и "bat" равно 1.
Что такое сходство Джаро-Винклера?
Джаро-Винклер даёт более высокие оценки строкам с общим префиксом. Широко используется для сопоставления имён, адресов и записей в базах данных с опечатками.
Как работает косинусное сходство?
Косинусное сходство разбивает строки на символьные n-граммы, преобразует их в векторы и измеряет косинус угла между ними. Хорошо подходит для длинных текстов.
В чём разница между косинусным сходством и Жаккаром?
Косинусное сходство использует векторы частот n-грамм и измеряет угол между ними, а Жаккард сравнивает множества n-грамм через отношение пересечения к объединению. Жаккард игнорирует дубликаты; косинус — нет.
Что такое расстояние Хэмминга?
Расстояние Хэмминга подсчитывает количество позиций, в которых соответствующие символы двух строк одинаковой длины различаются. Работает только для строк равной длины.
Что такое коэффициент Сёренсена-Дайса?
Коэффициент Сёренсена-Дайса измеряет сходство на основе количества общих биграмм относительно общего числа биграмм в обеих строках. Даёт больший вес общим элементам, чем Жаккард.
Какой алгоритм выбрать?
Для коротких строк с опечатками (имена, коды) используйте Левенштейна или Джаро-Винклера. Для длинных текстов — косинусное сходство. Для быстрого сравнения множеств — Жаккард.
Что такое n-граммный анализ?
N-грамма — это непрерывная последовательность из n символов строки. Например, биграммы слова "hello": "he", "el", "ll", "lo". N-граммы — основа многих алгоритмов сходства.
Что такое нечёткое сравнение?
Нечёткое сравнение находит строки, приблизительно совпадающие с шаблоном, а не точно. Используется в поисковых системах, проверке орфографии и очистке данных.
Отправляются ли мои данные на сервер?
Нет, все вычисления выполняются локально в вашем браузере. Ваш текст никогда не покидает устройство. Никакой серверной обработки или хранения данных.
Можно ли сравнивать тексты на разных языках?
Да, алгоритмы работают с любыми символами Unicode. Однако результаты могут отличаться, так как разные языки имеют разную структуру символов.