> soundex | fonético | fuzzy <
// Soundex - algoritmo fonético para indexar nomes pelo som
Baseado em som
Codifica nomes com base na pronúncia, não apenas na grafia.
Correspondência aproximada
Encontra nomes com som parecido mesmo quando escritos de forma diferente.
Genealogia
Ferramenta essencial para pesquisa genealógica e arquivos históricos.
>> detalhes técnicos
Como o Soundex funciona:
O Soundex mantém a primeira letra e substitui as consoantes por dígitos de acordo com grupos fonéticos. Consoantes com sons semelhantes recebem o mesmo número, as vogais são ignoradas e o resultado é preenchido ou truncado para 4 caracteres (American) ou um comprimento variável (Refined).
Regras de codificação:
1 = B,F,P,V 2 = C,G,J,K,Q,S,X,Z 3 = D,T 4 = L 5 = M,N 6 = R Robert → R163 Rupert → R163 Rubin → R150
Por que usar o Soundex?:
- >Remoção de duplicatas em bancos de dados
- >Pesquisa genealógica
- >Análise de dados de censo
- >Correspondência de registros de clientes
- >Correção ortográfica
>> perguntas frequentes
O que é o Soundex?
Soundex é um algoritmo fonético criado em 1918 para indexar nomes pelo som. Ele foi projetado para o censo dos EUA a fim de localizar sobrenomes com pronúncias semelhantes, mesmo que a grafia seja diferente.
Qual a diferença entre American e Refined Soundex?
O American Soundex produz códigos com 4 caracteres (uma letra + 3 dígitos). O Refined Soundex (usado, por exemplo, no SQL Server) utiliza mapeamentos mais detalhados e códigos de comprimento variável para obter maior precisão.
Por que grafias diferentes recebem o mesmo código?
Esse é justamente o objetivo do Soundex. Ele agrupa nomes que soam parecidos – como Smith e Schmidt – facilitando a localização de variações do mesmo nome em um banco de dados.
Quais são as limitações do Soundex?
O Soundex foi pensado principalmente para nomes em inglês. Para outros idiomas a precisão pode ser menor e grafias muito diferentes de um mesmo nome podem gerar códigos distintos.
// Referência rápida
| Digit | Letters |
|---|---|
| 1 | B F P V |
| 2 | C G J K Q S X Z |
| 3 | D T |
| 4 | L |
| 5 | M N |
| 6 | R |
| — | A E I O U Y H W (skipped) |
// Exemplos de código
1. Keep the first letter. 2. Replace the other letters with digits (table above). 3. Drop vowels and Y; H and W are skipped (letters on both sides of H/W with the same code collapse into one digit). 4. Collapse adjacent identical digits. 5. Pad with 0 or truncate to letter + 3 digits. Robert -> R163 Rupert -> R163 Rubin -> R150 Ashcraft -> A261 Tymczak -> T522 Pfister -> P236
>> Mais perguntas
P: Por que Robert e Rupert têm o mesmo código Soundex?
R: Ambos começam com R e são codificados por grupos de consoantes: B/P → 1, R → 6, T → 3 dá R163. O Soundex agrupa consoantes de som parecido, então variantes do mesmo nome costumam coincidir.
P: Como o Soundex trata H e W?
R: H e W são ignorados e não separam: se as consoantes dos dois lados têm o mesmo código, contam como um único som. Por isso Ashcraft dá A261 e não A226. As vogais separam.
P: Quais os limites do Soundex?
R: Foi criado para nomes ingleses (patentes de 1918/1922 de Russell e Odell) e ignora o som após a primeira letra. Nomes com inicial diferente, como Catherine e Katherine, não coincidem.