kodla | çöz | sıkıştır

> soundex | fonetik | bulanık eşleştirme <

// Soundex - isimleri seslerine göre indeksleyen fonetik algoritma

[PHONETIC]

Ses temelli

İsimleri yazılışına değil, telaffuzuna göre kodlar.

[FUZZY]

Bulanık eşleştirme

Farklı yazılsa bile benzer sesli isimleri bulur.

[GENEALOGY]

Soy ağacı

Soy ağacı çalışmaları ve tarihsel kayıtlar için kullanışlı bir araçtır.

>> teknik bilgiler

Soundex nasıl çalışır?:

Soundex ilk harfi korur ve kalan ünsüzleri fonetik gruplara göre rakamlara dönüştürür. Benzer sesli ünsüzler aynı rakamı alır, ünlüler yok sayılır ve sonuç 4 karaktere (American) doldurulur veya Refined için değişken uzunlukta bırakılır.

Kodlama kuralları:

1 = B,F,P,V 2 = C,G,J,K,Q,S,X,Z 3 = D,T 4 = L 5 = M,N 6 = R Robert → R163 Rupert → R163 Rubin → R150

Neden Soundex kullanmalı?:

  • >Veritabanlarında çift kayıtları bulma
  • >Soy ağacı ve aile araştırmaları
  • >Nüfus sayımı verilerinin analizi
  • >Müşteri kayıtlarını eşleştirme
  • >Yazım hatalarını düzeltme

>> sık sorulan sorular

Soundex nedir?

Soundex, 1918 yılında isimleri seslerine göre indekslemek için geliştirilen bir fonetik algoritmadır. ABD nüfus sayımı için tasarlanmış olup, farklı yazılsa bile benzer telaffuzlu soyadlarını bulmayı kolaylaştırır.

American ve Refined Soundex arasındaki fark nedir?

American Soundex, bir harf ve üç rakamdan oluşan 4 karakterlik kodlar üretir. Refined Soundex (örneğin SQL Server’da kullanılır) daha ayrıntılı eşleştirmeler ve değişken uzunlukta kodlar kullanarak eşleştirme doğruluğunu artırır.

Neden farklı yazımlar aynı kodu alabiliyor?

Bu, Soundex’in amacıdır. Smith ve Schmidt örneğinde olduğu gibi, benzer telaffuza sahip isimleri aynı grupta toplayarak veritabanlarında isim varyasyonlarını bulmayı kolaylaştırır.

Soundex’in kısıtları nelerdir?

Soundex esas olarak İngilizce isimler için tasarlanmıştır. Diğer dillerde doğruluk düşebilir ve aynı ismin çok farklı yazımları farklı kodlar üretebilir.

// Hızlı başvuru

DigitLetters
1B F P V
2C G J K Q S X Z
3D T
4L
5M N
6R
—A E I O U Y H W (skipped)

// Kod örnekleri

1. Keep the first letter.
2. Replace the other letters with digits (table above).
3. Drop vowels and Y; H and W are skipped (letters on both sides of H/W
   with the same code collapse into one digit).
4. Collapse adjacent identical digits.
5. Pad with 0 or truncate to letter + 3 digits.

Robert -> R163   Rupert -> R163   Rubin -> R150
Ashcraft -> A261   Tymczak -> T522   Pfister -> P236

>> Daha fazla soru

S: Robert ve Rupert neden aynı Soundex koduna sahip?

C: İkisi de R ile başlar ve ünsüzler gruplarla kodlanır: B/P → 1, R → 6, T → 3 sonucu R163. Soundex benzer sesli ünsüzleri gruplar; bu yüzden aynı ismin yazım varyantları çoğunlukla eşleşir.

S: Soundex H ve W’yi nasıl işler?

C: H ve W atlanır ve ayırıcı değildir: iki yanındaki ünsüzlerin kodu aynıysa tek ses sayılır. Bu yüzden Ashcraft, A226 değil A261 olur. Ünlüler ise ayırır.

S: Soundex’in sınırları nelerdir?

C: İngilizce isimler için tasarlandı (Russell ve Odell’in 1918/1922 patentleri) ve ilk harften sonraki sesi ayırt etmez. Catherine ve Katherine gibi ilk harfi farklı isimler eşleşmez.

Diğer diller