codificar | decodificar | comprimir

> soundex | fonético | fuzzy <

// Soundex - algoritmo fonético para indexar nomes pelo som

[PHONETIC]

Baseado em som

Codifica nomes com base na pronúncia, não apenas na grafia.

[FUZZY]

Correspondência aproximada

Encontra nomes com som parecido mesmo quando escritos de forma diferente.

[GENEALOGY]

Genealogia

Ferramenta essencial para pesquisa genealógica e arquivos históricos.

>> detalhes técnicos

Como o Soundex funciona:

O Soundex mantém a primeira letra e substitui as consoantes por dígitos de acordo com grupos fonéticos. Consoantes com sons semelhantes recebem o mesmo número, as vogais são ignoradas e o resultado é preenchido ou truncado para 4 caracteres (American) ou um comprimento variável (Refined).

Regras de codificação:

1 = B,F,P,V 2 = C,G,J,K,Q,S,X,Z 3 = D,T 4 = L 5 = M,N 6 = R Robert → R163 Rupert → R163 Rubin → R150

Por que usar o Soundex?:

  • >Remoção de duplicatas em bancos de dados
  • >Pesquisa genealógica
  • >Análise de dados de censo
  • >Correspondência de registros de clientes
  • >Correção ortográfica

>> perguntas frequentes

O que é o Soundex?

Soundex é um algoritmo fonético criado em 1918 para indexar nomes pelo som. Ele foi projetado para o censo dos EUA a fim de localizar sobrenomes com pronúncias semelhantes, mesmo que a grafia seja diferente.

Qual a diferença entre American e Refined Soundex?

O American Soundex produz códigos com 4 caracteres (uma letra + 3 dígitos). O Refined Soundex (usado, por exemplo, no SQL Server) utiliza mapeamentos mais detalhados e códigos de comprimento variável para obter maior precisão.

Por que grafias diferentes recebem o mesmo código?

Esse é justamente o objetivo do Soundex. Ele agrupa nomes que soam parecidos – como Smith e Schmidt – facilitando a localização de variações do mesmo nome em um banco de dados.

Quais são as limitações do Soundex?

O Soundex foi pensado principalmente para nomes em inglês. Para outros idiomas a precisão pode ser menor e grafias muito diferentes de um mesmo nome podem gerar códigos distintos.

// Referência rápida

DigitLetters
1B F P V
2C G J K Q S X Z
3D T
4L
5M N
6R
—A E I O U Y H W (skipped)

// Exemplos de código

1. Keep the first letter.
2. Replace the other letters with digits (table above).
3. Drop vowels and Y; H and W are skipped (letters on both sides of H/W
   with the same code collapse into one digit).
4. Collapse adjacent identical digits.
5. Pad with 0 or truncate to letter + 3 digits.

Robert -> R163   Rupert -> R163   Rubin -> R150
Ashcraft -> A261   Tymczak -> T522   Pfister -> P236

>> Mais perguntas

P: Por que Robert e Rupert têm o mesmo código Soundex?

R: Ambos começam com R e são codificados por grupos de consoantes: B/P → 1, R → 6, T → 3 dá R163. O Soundex agrupa consoantes de som parecido, então variantes do mesmo nome costumam coincidir.

P: Como o Soundex trata H e W?

R: H e W são ignorados e não separam: se as consoantes dos dois lados têm o mesmo código, contam como um único som. Por isso Ashcraft dá A261 e não A226. As vogais separam.

P: Quais os limites do Soundex?

R: Foi criado para nomes ingleses (patentes de 1918/1922 de Russell e Odell) e ignora o som após a primeira letra. Nomes com inicial diferente, como Catherine e Katherine, não coincidem.

Outros idiomas