> soundex | phonetisch | fuzzy <
// Soundex – phonetischer Algorithmus zum Indizieren von Namen nach Klang
Klangbasiert
Kodiert Namen anhand der Aussprache statt der Schreibweise.
Unscharfe Suche
Findet ähnlich klingende Namen trotz unterschiedlicher Schreibweise.
Ahnenforschung
Unverzichtbares Werkzeug für Genealogie und historische Register.
>> technische details
Wie Soundex funktioniert:
Soundex behält den ersten Buchstaben und ersetzt Konsonanten durch Ziffern, die phonetischen Gruppen entsprechen. Ähnlich klingende Konsonanten erhalten denselben Code, Vokale werden ignoriert und das Ergebnis wird auf 4 Zeichen aufgefüllt oder gekürzt (American) bzw. variabel lang (Refined).
Kodierregeln:
1 = B,F,P,V 2 = C,G,J,K,Q,S,X,Z 3 = D,T 4 = L 5 = M,N 6 = R Robert → R163 Rupert → R163 Rubin → R150
Warum Soundex verwenden?:
- >Dublettenerkennung in Datenbanken
- >Genealogische Forschung
- >Auswertung von Volkszählungen
- >Kunden‑ und Kontakten‑Matching
- >Rechtschreibkorrektur
>> häufige fragen
Was ist Soundex?
Soundex ist ein phonetischer Algorithmus aus dem Jahr 1918, der Namen nach ihrem Klang indexiert. Er wurde für die US‑Volkszählung entwickelt, damit sich Familiennamen mit ähnlicher Aussprache trotz verschiedener Schreibweise leichter finden lassen.
American vs. Refined Soundex?
American Soundex erzeugt Codes mit vier Zeichen (Buchstabe + 3 Ziffern). Refined Soundex (u.a. in SQL Server) verwendet feinere Gruppen und Codes variabler Länge für höhere Genauigkeit.
Warum erhalten verschiedene Schreibweisen denselben Code?
Das ist genau der Zweck von Soundex! Der Algorithmus gruppiert ähnlich klingende Namen zusammen. Smith und Schmidt klingen ähnlich und erhalten daher ähnliche Codes – so finden Sie Varianten eines Namens leichter.
Welche Grenzen hat Soundex?
Soundex funktioniert am besten mit englischen Namen. Für andere Sprachen kann die Qualität variieren, und sehr unterschiedliche Schreibweisen desselben Namens können unterschiedliche Codes erzeugen.
// Kurzreferenz
| Digit | Letters |
|---|---|
| 1 | B F P V |
| 2 | C G J K Q S X Z |
| 3 | D T |
| 4 | L |
| 5 | M N |
| 6 | R |
| — | A E I O U Y H W (skipped) |
// Codebeispiele
1. Keep the first letter. 2. Replace the other letters with digits (table above). 3. Drop vowels and Y; H and W are skipped (letters on both sides of H/W with the same code collapse into one digit). 4. Collapse adjacent identical digits. 5. Pad with 0 or truncate to letter + 3 digits. Robert -> R163 Rupert -> R163 Rubin -> R150 Ashcraft -> A261 Tymczak -> T522 Pfister -> P236
>> Weitere Fragen
F: Warum haben Robert und Rupert denselben Soundex-Code?
A: Beide beginnen mit R und werden nach den Konsonanten-Gruppen gleich kodiert: B/P → 1, R → 6, T → 3 ergibt R163. Soundex gruppiert ähnlich klingende Konsonanten, daher sind Schreibvarianten desselben Namens oft ein Treffer.
F: Wie behandelt Soundex H und W?
A: H und W werden übersprungen und trennen nicht: Haben die Konsonanten links und rechts davon denselben Code, zählen sie als ein Laut. Deshalb ergibt Ashcraft A261 statt A226. Vokale dagegen trennen gleiche Codes.
F: Wo liegen die Grenzen von Soundex?
A: Es wurde für englische Namen entwickelt (Patente 1918/1922 von Russell und Odell) und ignoriert Lautwerte nach dem ersten Buchstaben. Namen mit abweichendem Anfangsbuchstaben, etwa Catherine und Katherine, passen daher nicht zusammen.