स्ट्रिंग समानता
Levenshtein, Jaro-Winkler, Cosine, Jaccard, Hamming और Dice एल्गोरिदम से दो स्ट्रिंग की तुलना करें। तुरंत परिणाम, 100% निजी।
स्ट्रिंग समानता क्या है?
स्ट्रिंग समानता मापती है कि दो टेक्स्ट स्ट्रिंग एक दूसरे से कितनी मेल खाती हैं। इसका उपयोग स्पेल चेकिंग, DNA विश्लेषण, प्लेजियरिज़्म डिटेक्शन और डेटा डुप्लिकेशन में होता है।
Levenshtein दूरी क्या है?
Levenshtein दूरी (एडिट डिस्टेंस) एक स्ट्रिंग को दूसरी में बदलने के लिए आवश्यक न्यूनतम एकल-अक्षर संपादन — सम्मिलन, हटाना या प्रतिस्थापन — की संख्या मापती है। उदाहरण के लिए, "cat" और "bat" के बीच की दूरी 1 है।
Jaro-Winkler समानता क्या है?
Jaro-Winkler उन स्ट्रिंग्स को उच्च अंक देता है जो एक सामान्य उपसर्ग साझा करती हैं। इसका उपयोग डेटाबेस में नाम, पते और रिकॉर्ड मिलान के लिए व्यापक रूप से किया जाता है।
Cosine समानता कैसे काम करती है?
Cosine समानता स्ट्रिंग्स को अक्षर n-grams में तोड़ती है, उन्हें वेक्टर में बदलती है और उनके बीच के कोण के cosine को मापती है। यह लंबे टेक्स्ट के लिए अच्छा काम करती है।
Cosine और Jaccard समानता में क्या अंतर है?
Cosine समानता n-gram आवृत्ति वेक्टर का उपयोग करती है और उनके बीच का कोण मापती है, जबकि Jaccard n-gram सेट्स की तुलना intersection/union अनुपात से करती है। Jaccard डुप्लीकेट को नजरअंदाज करता है; Cosine नहीं।
Hamming दूरी क्या है?
Hamming दूरी दो समान-लंबाई स्ट्रिंग्स के बीच संबंधित अक्षरों के भिन्न होने की स्थितियों की संख्या गिनती है। यह केवल समान लंबाई की स्ट्रिंग्स पर काम करती है।
Sørensen-Dice गुणांक क्या है?
Sørensen-Dice गुणांक दोनों स्ट्रिंग्स में कुल बाइग्राम्स की तुलना में साझा बाइग्राम्स की संख्या के आधार पर समानता मापता है। यह Jaccard की तुलना में सामान्य तत्वों को अधिक वजन देता है।
मुझे कौन सा एल्गोरिदम इस्तेमाल करना चाहिए?
टाइपो वाली छोटी स्ट्रिंग्स (नाम, कोड) के लिए Levenshtein या Jaro-Winkler का उपयोग करें। लंबे टेक्स्ट के लिए Cosine समानता सबसे अच्छी है। त्वरित सेट तुलना के लिए Jaccard का उपयोग करें।
n-gram विश्लेषण क्या है?
n-gram एक स्ट्रिंग से n अक्षरों का एक सतत अनुक्रम है। उदाहरण के लिए, "hello" के बाइग्राम हैं "he", "el", "ll", "lo"। n-grams कई समानता एल्गोरिदम की आधारशिला हैं।
फ़ज़ी मैचिंग क्या है?
फ़ज़ी मैचिंग ऐसी स्ट्रिंग्स खोजती है जो किसी पैटर्न से लगभग मेल खाती हैं, बिल्कुल नहीं। इसका उपयोग सर्च इंजन, स्पेल चेकर और डेटा क्लीनिंग में होता है।
क्या मेरा डेटा सर्वर पर भेजा जाता है?
नहीं, सभी गणनाएं आपके ब्राउज़र में स्थानीय रूप से की जाती हैं। आपका टेक्स्ट कभी भी आपके डिवाइस को नहीं छोड़ता। कोई सर्वर-साइड प्रोसेसिंग या डेटा स्टोरेज नहीं है।
क्या मैं विभिन्न भाषाओं के टेक्स्ट की तुलना कर सकता हूं?
हां, एल्गोरिदम किसी भी Unicode अक्षरों पर काम करते हैं। हालांकि, परिणाम भिन्न हो सकते हैं क्योंकि विभिन्न भाषाओं की अक्षर संरचनाएं अलग होती हैं।