O que é e quando funciona
A junção das vogais é um recurso tipográfico e fonético que trata da aproximação ou fusão de sons vocálicos adjacentes. Em português brasileiro, especialmente na fala coloquial, dois vogais que ficam seguidas — como em "ci-ada" ou "ma-is" — tendem a se fundir numa sílaba só. Isso não é regra ortográfica, é comportamento natural da língua. Quando você trabalha com design de fônicas, transcrição fonética ou síntese de voz, precisa lidar com isso todo dia. Eu já passei problema sério com isso num projeto de TTS (text-to-speech) para uma rádio regional. O motor que usávamos segmentava sílabas de forma ingênua: "aéu" virava /a.e.u/ em vez de /aj/. Ou seja, a junção das vogais era interpretada literalmente, gerando pronúncias artificiais que soavam robotizadas. A solução foi implementar um grafo de regras fonológicas específicas para ditongos decrescentes e levadas vocálicas, mapeando sequências de vogais idiomáticas antes da síntese rodar. O resultado melhorou a naturalidade drasticamente, mas o processo de mapeamento levou cerca de 3 semanas de ajustes.
junção das vogais na prática
O conceito parece simples, mas tem nuances que quebram quem não presta atenção. Vou direto ao ponto.
Como identificar as sequências que se fundem
Vogais idênticas consecutivas nunca se fundem — elas mantêm a boundary silábica. "Café antigo" mantém o /e/ e o /a/ separados. Vogais diferentes sim, principalmente quando há hiato que evoluiu para ditongo na pronúncia corrente. Aqui vai a lista prática que eu uso: Vogal + i ou u tônicos formam ditongo decrescente. "Família" não é /fa.mi.li.a/, é /fa.mi.lic/ com o i semivogal. O mesmo vale para "país" (/pa.jis/), "viúvo" (/vi.u.vu/ no formal, mas /vjivo/ no cotidiano).
Iluquídeos e ditongos orais são onde os sistemas erram mais. Sequências como "ia", "ie", "io", "ua", "ue", "uo" precisam ser tratadas como núcleos ditongados quando o primeiro elemento é /i/ ou /u/ tônico ou átono e o segundo é aberto. O problema é que a escrita não mostra isso. "Sábia" pode ser lido como /sa.bi.a/ ou /sa.bja/ dependendo do contexto regional. Ditongos nasais introduzem outra variável. "Pé" + "leite" não tem junção, mas "pé de leite" na fala rápida vira /pe.de.lei.t/ com perda da nasalidade. Sistemas de fonética computacional perdem isso porque não rastreiam contexto prosódico.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O truque que ninguém ensina
A maioria dos tools de segmentação silábica falha exatamente nos casos de vogal final de palavra + vogal inicial da palavra seguinte no fluxo contínuo. Isso se chama sinalefa fonológica. O algoritmo vê dois tokens e corta entre eles. Na realidade fonética, a fronteira desaparece. Minha abordagem foi criar um pré-processador que opera em strings brutas antes de qualquer outra etapa. Ele aplica estas regras na ordem certa:
- Identifica todas as sequências CV|V (consoante-vogal seguida de vogal) na fronteira de palavras.
- Mapeia as combinações para ditongos reconhecidos do português usando uma tabela de referência que inclui variantes regionais.
- Para combinações fora do mapeamento, aplica a regra geral: vogal + i/u não tônica vira semivogal; vogal + vogal diferente tende à fusão com alongamento do primeiro elemento.
- Retorna o texto re-segmentado para a etapa seguinte.
Isso reduziu o tempo de pós-processamento manual de horas para minutos por milhão de tokens.
Limitações reais
Esse método não funciona bem em textos poéticos ou letras de música, onde a separação silábica é intencional. Também falha em empréstimos linguísticos como "pizza" (/pi.tsa/) ou "futebol" (/fu.te.bo/) onde a junção esperada pelo algoritmo não corresponde à pronúncia real. Nesses casos, o processamento retorna resultados inconsistentes e o erro é mais comum do que se imagina. A recomendação é usar essa técnica apenas para português padrão e falar cotidiana. Para línguas estrangeiras com sílabas fechadas ou para escrita formal, o melhor é desativar e deixar a segmentação padrão rodar.
Recursos
Não existe uma biblioteca consolidada em português para junção das vogais pronta para baixar. O que eu faço é puxar o processador fonológico do Phonix — projeto open-source da USP — e adaptar as regras de ditongação. Ele tem suporte a português brasileiro e você encontra em https://github.com/uspoax/phonix. Também recomendo olhar o Prosogram do LabFon/Unicamp, que tem regras fonológicas implementadas para variações regionais. Se precisar de algo mais específico para síntese de voz, o TTS-Fone é outra opção aberta com mapeamento fonêmico para português. Link: https://github.com/fgvai/tts-fone.