Como lidar com palavras que têm mais de um sentido em português
Trabalho com análise de texto há quinze anos e a maior dor que encontro não é ambiguidade lexicale, é o que acontece quando um sistema de busca ou um chatbot tenta processar palavras com varios significados sem entender o contexto correto. Já vi gente gastar dias inteiros afinando modelos só para descobrir que o problema era um homógrafo que mudou de categoria gramatical no meio do parágrafo. Vou explicar primeiro a técnica que uso, porque a definição sozinha não resolve nada na prática. O método se chama análise distributiva combinada com marcadores contextuais. Basicamente, você coleta os arredores de cada ocorrência da palavra em questão — os termos que aparecem antes, depois, os verbos que a acompanham, as preposições que regem — e constrói um perfil estatístico para decidir qual sentido está ativo naquele trecho específico. Isso funciona bem para textos formais, mas começa a falhar em linguagem coloquial, gírias regionais ou textos irônicos, onde o sentido literal propositalmente é ignorado.
Palavras com varios significados: o problema real
O termo técnico para isso é polissemia, mas todo mundo que trabalha com processamento de linguagem natural ou tradução automática conhece a diferença prática entre polissemia verdadeira e homonímia. Na polissemia, os sentidos estão semanticamente relacionados por alguma lógica histórica ou cognitiva. No homonimo completo, os sentidos são acidentais, surgiram de fontes etimológicas diferentes que colidiram na forma escrita. Um exemplo que uso sempre nos treinamentos: a palavra banco em português tem pelo menos três sentidos polissêmicos relacionados ao conceito de entidade que oferece serviço — banco financeiro, banco escolar, banco de dados. Mas banco como mobília tem origem completamente diferente, do italiano *banca* (banco de cambista) versus o germano bank (assento). Quando você encontra "sentou no banco do carro", não é ambiguidade real, é um homógrafo que já foi desambiguado pela seleção lexical automática. O mesmo vale para cabo — pode ser fio elétrico, bastão militar, ou nome próprio de lugar. O contexto que decide, nunca a palavra isolada.
Como eu faço a desambiguação na prática
A abordagem que eu adotei e recomendo para quem quer implementar algo similar começa com a construção de um sistema de ponderação contextual baseado em co-ocorrência. Você treina um classificador simples com features como posição sintática, vetores de vizinhança, frequência condicional dos sentidos em corpora específicos, e marcações morfológicas que indicam categoria gramatical. Em textos técnicos ou jurídicos, esse sistema atinge precisão de 92 a 95 por cento. Em redes sociais ou literatura contemporânea, cai para 70 a 75 por cento, porque o uso figurado e irônico quebra todas as suposições estatísticas. O detalhe que todo mundo perde é que a desambiguação não é um problema binário. Você não precisa acertar o sentido correto o tempo todo, só precisa evitar os erros catastróficos. Um tradutor automático que confunde companheiro (cônjuge) com colega de trabalho em um contrato gera prejuízo real. Um que faz a mesma confusão em uma legenda de meme não causa dano. Por isso eu sempre peço para calibrar o sistema por custo de erro, não por acurácia bruta.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Um caso específico que me marcou aconteceu há três anos, quando estávamos implementando um parser para textos jurídicos brasileiros. A palavra legítimo aparecia em 47 contextos diferentes, e o sistema clássico de desambiguação por vector space falhava feio porque os sentidos jurídicos e coloquiais se sobrepunham semanticamente. A solução foi criar um módulo de restrição baseada em frames legais, onde cada ocorrência da palavra era verificada contra um grafo de relações hierárquicas entre conceitos jurídicos. Em vez de tentar classificar por similaridade semântica, restringimos o espaço de hipóteses aos sentidos permitidos pelo domínio textuaispecífico. O tempo de processamento triplicou, mas a taxa de erro caiu de 18 por cento para 3 por cento. Compensa o custo computacional quando você lida com contratos de milhões de reais.
Erros comuns que eu vejo no dia a dia
O primeiro erro é tentar resolver tudo com dicionários estáticos de sentidos. Isso funciona para línguas como inglês, onde a norma é mais conservadora, mas em português — especialmente no português brasileiro contemporâneo — os sentidos novose expandem rapidamente. Palavra como fileira ganhou novo sentido em gíria estudantil nos últimos cinco anos, e nenhum dicionário ainda registrou. O segundo erro é confiar em embedding vectors sem validação contextual. Um modelo como Word2Vec ou BERT captura similaridade superficial, mas não distingue entre polissemia produtiva e homonímia acidental sem treino adicional específico do domínio. O terceiro erro, que é o mais perigoso, é não reconhecer quando o sistema deve simplesmente marcar como ambíguo e consultar um especialista humano. Existe um limiar de confiança abaixo do qual continuar automatizando é pior do que parar. Eu estabeleço um teto de 85 por cento de confiança para decisões autônomas, e acima disso delego para revisão manual. O custo humano aumenta linearmente, mas o risco de erro crítico cai exponencialmente.
Quando esse método não funciona
A abordagem descritiva funciona bem para textos escritos formais, mas entra em colapso em discurso oral transcribedireto, onde a entonação e a pausacumprem papel desambiguador que o texto escrito não carrega. Uma palavra como que em português pode ser pronome relativo, conjunction, partícula expletiva, ou interrogativo, e nenhuma análise puramentesintática resolve sem informação prosódica. Também falha em textos deliberadamente ambiguosem, como poesia contemporânea, jogos de palavras, ou propaganda enganosa, onde a ambiguidade é recurso estilístico, não defeito a ser corrigido. Se o seu objetivo é construir um sistema que processe textos naturais sem supervisão humana constante, recomendo começar com análise de domínio restrito. Filtre os textos pelos quais o sistema vai operar, remova os casos extremos, e treine em dados que representam a distribuição real de uso. O resultado nunca será perfeito, mas será previsivelmente imperfeito, o que é muito melhor do que falhar aleatoriamente em casos críticos.
Para quem quer se aprofundar, a literatura técnica sobre o assunto começa com os trabalhos de Cruse (2000) sobre semântica lexical, passa por Glory & Lapata (2016) em desambiguação computacional, e chega às aplicações práticas em Silva et al. (2022) para português brasileiro. Nada substitui a prática, mas dar um jeito neles é mais simples do que parece quando você entende onde a armadilha está.