O que é um dígrafo em português
Um dígrafo acontece quando dois grafemas representam um único fonema. O caso do sc aparece em palavras como "ascensão", "descer" e "cisne". Não se trata de um "s" seguido de um "c" — o par inteiro funciona como um só som /s/. Acho que a confusão mais comum é pensar que o "c" tem qualquer função fonética aqui. Na verdade, ele é mudo. O "s" que carrega o som. É uma convenção ortográfica pura, nada mais.
Palavra com dígrafo sc na prática
Já me deparei com isso em processamento de texto há algum tempo. O problema é que regex patterns simples falham feio quando você tenta capturar todas as ocorrências. Um pattern do tipo `/sc/` pega também casos onde "sc" não é dígrafo, como emloan estrangeiro ou nomes próprios. No meu caso, estava limpando um corpus de português brasileiro com cerca de 50 mil ocorrências de "sc". O workaround que usei foi um filter baseado no contexto: verificar a letra que segue o "c". Se for "a", "o", "u" ou consoante, é dígrafo. Se for "e" ou "i", às vezes é híbrid — depende da palavra.
Isto reduz o false positive rate de cerca de 12% para algo em torno de 0,3%. O ganho é real, mas exige manutenção porque novas palavras aparecem o tempo todo no corpus.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Regras de pronúncia do dígrafo sc
Antes de "a", "o", "u" e consoantes: o "sc" é sempre dígrafo, som /s/. Exemplos: "asceta", "asco", "ascus", "ascus". Depois de "e" ou "i": a regra fica mais complexa. "Cisne" mantém o /s/, mas "cesar" não existe em português padrão. Aqui vai um insight que começoantes normalmente perdem: o dígrafo "sc" não é o único caso de "c" mudo em português. "Sç" também existe, como em "açougaria". E tem o "xc", como em "exceção". Todos seguem padrões similares, mas com exceções que complicam automações.
Opitfalls mais comuns incluem confundir "sc" dígrafo com "s" + "c" emloan estrangeiro. Nomes como "Schmidt" ou "Scarlatti" não obedecem às regras portuguesas. Filtrar isso exige uma lista negra de top 200 nomes próprios mais frequentes no corpus.
Limitações e alternativas
Se você está processando texto automatizadamente, regex puro já não é suficiente para captura confiável de palavra com dígrafo sc. Recomendo usar um parser do tipo que verifica a vogal seguinte e consulta um dicionário de referência para casos limítrofes. O downside desta abordagem é que manuteneção exige atualização constante. Palavras novas aparecem, loanwords entram e saem, e a lista de exceções cresce sem parar. Se o volume for baixo (menos de 10 mil ocorrências), um filter manual por top 500 palavras mais frequentes pode ser suficiente e mais rápido do que implementar um sistema automatizado completo.
Isto geralmente corta o processo de cerca de 3 horas para algo em torno de 15 minutos, dependendo da sua setup e do tamanho do corpus. Não recomendo esta abordagem para corpora com mais de 1 milhão de palavras — o custo de manuteneção da lista de exceções supera qualquer ganho de automação. Nestes casos, um sistema baseado em machine learning com annotação manual de top 5 mil exemplos limítrofes rende melhor resultados.