> soundex | ध्वन्यात्मक | फज़ी मैच <
// Soundex - नामों को ध्वनि के आधार पर इंडेक्स करने वाला एल्गोरिदम
ध्वनि आधारित
नामों को वर्तनी के बजाय उच्चारण के आधार पर कोड करता है।
फज़ी मैचिंग
ऐसे नाम खोजता है जिनकी आवाज़ मिलती‑जुलती हो, भले ही वर्तनी अलग हो।
वंशावली शोध
वंशावली और ऐतिहासिक रिकॉर्ड के लिए उपयोगी उपकरण।
>> तकनीकी जानकारी
Soundex कैसे काम करता है:
Soundex पहले अक्षर को जस का तस रखता है और बाकी व्यंजनों को ध्वन्यात्मक समूहों के आधार पर अंकों से बदलता है। समान ध्वनि वाले व्यंजन एक ही अंक साझा करते हैं, स्वर अनदेखे किए जाते हैं और परिणाम को 4 अक्षरों (American) या परिवर्तनीय लंबाई (Refined) तक पैड किया जाता है।
एन्कोडिंग नियम:
1 = B,F,P,V 2 = C,G,J,K,Q,S,X,Z 3 = D,T 4 = L 5 = M,N 6 = R Robert → R163 Rupert → R163 Rubin → R150
Soundex क्यों उपयोग करें?:
- >डेटाबेस में डुप्लिकेट हटाना
- >वंशावली / पारिवारिक शोध
- >जनगणना डेटा विश्लेषण
- >ग्राहक रिकॉर्ड मिलान
- >स्पेलिंग सुधार
>> सामान्य प्रश्न
Soundex क्या है?
Soundex एक ध्वन्यात्मक एल्गोरिदम है जिसे 1918 में पेटेंट कराया गया था। इसे नामों को उनके उच्चारण के आधार पर इंडेक्स करने के लिए बनाया गया था ताकि अमेरिकी जनगणना में मिलते‑जुलते उपनाम आसानी से खोजे जा सकें।
American और Refined Soundex में क्या अंतर है?
American Soundex 4‑अक्षर वाले कोड बनाता है (एक अक्षर + 3 अंक)। Refined Soundex (जिसका उपयोग SQL Server आदि में होता है) अधिक विस्तृत मैपिंग और वैरिएबल‑लेंथ कोड का उपयोग करता है ताकि परिणाम अधिक सटीक हों।
अलग‑अलग वर्तनी को एक जैसा कोड क्यों मिलता है?
यही Soundex का उद्देश्य है! यह ऐसे नामों को एक साथ समूहित करता है जिनका उच्चारण समान होता है। उदाहरण के लिए Smith और Schmidt की आवाज़ काफ़ी मिलती जुलती है, इसलिए वे समान या मिलते‑जुलते कोड प्राप्त करते हैं।
Soundex की सीमाएँ क्या हैं?
Soundex मुख्य रूप से अंग्रेज़ी नामों के लिए डिज़ाइन किया गया है। अन्य भाषाओं के नामों के लिए यह उतना सटीक नहीं हो सकता, और बहुत अलग वर्तनी वाले समान नाम कभी‑कभी अलग कोड प्राप्त कर सकते हैं।
// त्वरित संदर्भ
| Digit | Letters |
|---|---|
| 1 | B F P V |
| 2 | C G J K Q S X Z |
| 3 | D T |
| 4 | L |
| 5 | M N |
| 6 | R |
| — | A E I O U Y H W (skipped) |
// कोड उदाहरण
1. Keep the first letter. 2. Replace the other letters with digits (table above). 3. Drop vowels and Y; H and W are skipped (letters on both sides of H/W with the same code collapse into one digit). 4. Collapse adjacent identical digits. 5. Pad with 0 or truncate to letter + 3 digits. Robert -> R163 Rupert -> R163 Rubin -> R150 Ashcraft -> A261 Tymczak -> T522 Pfister -> P236
>> और प्रश्न
प्र: Robert और Rupert का Soundex कोड समान क्यों है?
उ: दोनों R से शुरू होते हैं और व्यंजन समूहों से कोडित होते हैं: B/P → 1, R → 6, T → 3 से R163 बनता है। Soundex मिलती-जुलती ध्वनि वाले व्यंजनों को समूहित करता है, इसलिए एक ही नाम की वर्तनी के रूप अक्सर मेल खाते हैं।
प्र: Soundex H और W को कैसे संभालता है?
उ: H और W छोड़ दिए जाते हैं और विभाजक नहीं बनते: दोनों ओर के व्यंजनों का कोड समान हो तो वे एक ध्वनि गिने जाते हैं। इसलिए Ashcraft का कोड A226 नहीं, A261 है। स्वर विभाजक बनते हैं।
प्र: Soundex की सीमाएँ क्या हैं?
उ: इसे अंग्रेज़ी नामों के लिए बनाया गया था (Russell और Odell के 1918/1922 के पेटेंट) और यह पहले अक्षर के बाद की ध्वनि पर ध्यान नहीं देता। Catherine और Katherine जैसे अलग प्रथमाक्षर वाले नाम मेल नहीं खाते।