O guia prático para quem precisa lidar com palavras formadas exclusivamente por vogais
Você provavelmente nunca parou para pensar nisso, mas existe um conjunto bem específico de palavras em português que não contém nenhuma consoante. Apenas vogais. A, é, ó, ia, ai, eau — coisas assim. Pode parecer uma curiosidade sem graça, mas na prática, isso aparece em filtros de texto, validação de formulários e até em alguns algoritmos de processamento de linguagem natural que precisam separar padrões morfológicos.
Como identificar e extrair palavras só com vogais
A técnica mais direta envolve uma expressão regular simples. Se você está trabalhando com Python, por exemplo, o padrão seria algo como [aeiouAEIOU]+ aplicado a cada token do seu texto. O problema é que isso funciona perfeitamente no papel, mas na vida real você vai se deparar com questões de acentuação. A vogal "á" não é reconhecida pelo padrão acima, então palavras como "lá" ou "vó" seriam ignoradas erroneamente. A correção é usar o módulo unicodedata para normalizar os caracteres antes de aplicar o regex, transformando "á" em "a". Fiz isso uma vez num projeto de análise de letras de música onde precisava isolar vogais para calcular frequência fonética, e levei duas horas rastreando um bug que era simplesmente um acento agudo não mapeado. Em JavaScript o processo é similar, mas a normalização Unicode já vem embutida no método String.normalize('NFD'), o que facilita bastante. Basta decompor os acentos e remover os caracteres diacríticos antes de aplicar o filtro.
Exemplos reais em português
Dentro do português brasileiro, as palavras que contêm exclusivamente vogais são realmente poucas. Aqui estão as que aparecem com mais frequência:
- a (artigo)
- ai (interjeição)
- á (forma arcaica, raramente usada)
- é (verbo ser)
- oi (saudação)
- i (pronome ou nota musical)
- ô (interjeição ou forma coloquial)
- ia (pretérito imperfeito do indicativo de verbos como "amar")
- oe (rare, but appears in older texts)
- aa (vogal dupla em algumas palavras de origem indígena ou estrangeira)
A palavra "rua" não entra nessa categoria porque tem consoantes. "Ave" também não. Só mesmo as formas verdadeiramente monossílabas ou ditongos puros que funcionam como palavras autônomas no dicionário.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Quando isso é útil na prática
Isso pode parecer trivial, mas existem cenários onde filtrar por vogais puras faz sentido. Um deles é a validação de dados sensíveis: se você está limpando um dataset para um modelo de NLP e quer remover palavras que não carregam informação consonantal (que muitas vezes são stop words ou interjeições), esse filtro remove silêncios linguísticos rapidamente. Também é usado em testes de criptografia, onde vogais são tratadas como um grupo especial por serem mais frequentes em qualquer língua. Outro uso que encontrei foi num script de automação de planilhas onde precisava identificar linhas com dados corrompidos. Textos que continham apenas vogais frequentemente indicavam colunas que haviam sido concatenadas de forma errada ou que sofreram algum processo de limpeza mal feito. Foi uma forma rápida de spotar problemas em datasets de mais de 50 mil registros sem precisar ler cada linha manualmente.
Limitações e armadilhas
O principal problema é que esse filtro é muito restritivo. Se o seu objetivo é analisar fonética ou padrão vocálico de um texto inteiro, ele simplesmente não serve. A grande maioria das palavras em qualquer língua contém consoantes. Palavras como "amor", "vida", "tempo" são completamente ignoradas. Então depende inteiramente do que você precisa. Se o seu caso é mais amplo — como identificar padrões de vogais em palavras normais — o melhor caminho é usar uma regex que capture sequências vocálicas dentro de palavras completas, algo como [aeiouAEIOU]+ sem exigir que a palavra inteira seja só isso. Isso pega "a" em "amor", "i" em "vida", e assim por diante, e costuma ser muito mais útil na prática.
Também vale lembrar que hifenizações e palavras compostas podem quebrar a lógica. "Auto-estrada" tem vogais em ambas as partes, mas o hífen quebra o token. Num processamento ingênuo, cada parte seria analisada separadamente, o que pode gerar falsos positivos ou negativos dependendo do objetivo.
Alternativa mais robusta
Se você está construindo algo sério, sugiro usar uma biblioteca de processamento de texto como NLTK ou spaCy em vez de reinventar a roda com regex puro. Elas já lidam com tokenização, normalização Unicode e segmentação morfossintática de forma confiável. O ganho de tempo em relação a escrever e testar seus próprios filtros costuma ser de 3 a 5 horas de desenvolvimento para projetos pequenos, e bem mais para sistemas maiores. Resumindo: palavras só com vogais existem, são poucas em português, e o filtro é trivial de implementar com Normalização + Regex. O cuidado é saber quando esse filtro realmente ajuda e quando está criando mais trabalho do que resolvendo. Na maioria dos casos práticos, capturar sequências de vogais dentro de palavras normais entrega mais valor do que tentar isolar as poucas palavras inteiramente vocálicas.