A Utilização De Determinadas Variedades Linguísticas - A Utilização De Determinadas Variedades Linguísticas - NAZAEDU
A Utilização De Determinadas Variedades Linguísticas - NAZAEDU

O que acontece quando gente diferente fala a mesma língua

Eu trabalhava num projeto de processamento de linguagem natural há uns três anos, num modelo de classificador de sentimento voltado para texto de rede social. O que eu achava que ia ser simples foi um dos maiores dor de cabeça que já tive em produção. O modelo performava 94% de acurácia no dataset de treino e caía para 61% quando aplicamos em textos vindos do Nordeste do Brasil. Não era bug. Era a utilização de determinadas variedades linguísticas e eu não tinha preparado o sistema pra isso. A gente tem a tentação natural de pensar que língua é coisa unitária. Que se o modelo aprendeu português, ele entende português. Isso é ingenuidade técnica perigosa. O português brasileiro não é só uma versão do português com sotaque. As variedades linguísticas aqui dentro — variação regional, social, etária, de registro — são sistemas coerentes por si só, cada uma com sua gramática interna, seu léxico, suas regras morfosintáticas que às vezes colidem frontalmente com a norma-padrão.

a utilização de determinadas variedades linguísticas em sistemas de IA

O problema começa na coleta de dados. Quase todo dataset público de português que eu vi veio majoritariamente de São Paulo e do eixo Rio-Porto Alegre, escrito por pessoas com nível superior, num registro que mistura informalidade de WhatsApp com estrutura de frase de redação jornalística. O resultado: o modelo aprende que aquele é o português. Quando ele encontra um texto com marcadores do sertão nordestino, ou a sintaxe particular do contato entre línguas no Amazonas, ou simplesmente a variação de um trabalhador rural usando o sistema verbal de forma diferente, o modelo classifa errado ou simplesmente não reconhece. Num caso específico, tínhamos um bot de atendimento que rejeitava automaticamente mensagens com certas marcas do português africano de Angola. O usuário dizia "eu estou te chamando pra você vir cá" e o sistema entendia como spam ou mensagem maliciosamente ambígua. Não era malícia. Era uma construção perfeitamente válida em kimbundu-interagido com português, muito comum em Luanda. Passamos duas semanas depurando e a solução não foi refinar o modelo. Foi incluir explicitamente naquele corpus dados de falantes angolanos, moçambicanos e do interior brasileiro, além de adicionar peso maior a features que capturassem variação em vez de tratar como ruído.

👉 Clique no botão abaixo para saber mais sobre o assunto!

O que pouca gente admite é que existe um trade-off real aqui. Quanto mais você especializa um modelo pra uma variedade específica, pior ele fica nas outras. É um jogo de soma não-nula. Um modelo fine-tuned em caipira paulista vai sofrer em português de Florianópolis, e vice-versa. A saída prática que eu vi funcionar melhor foi arquitetura em camadas: primeiro um classificador de variedade linguística, depois modelos especializados por camada. Isso adiciona latência, mas a queda de acurácia que você evita compensa. Outro ponto cego: a norma-padrão como referência acaba sendo uma armadilha analítica. Eu via pesquisadores tratarem variantes regionais como "erros" a serem corrigidos antes do processamento. Correção ortográfica automática aplicando regras da norma culta em texto de comunidade quilombola no Espírito Santo destrói informação semântica importante. O que parece um erro gramatical pode ser marca identitária com conteúdo pragmático que o modelo precisa capturar, não apagar.

Se você está começando agora e quer se aventurar com isso, o conselho mais útil que eu posso dar é simples: pare de usar só dataset público. Vá atrás de corpus específicos da variedade que te interessa. Leia trabalhos de variacionismo linguístico antes de treinar qualquer coisa — os de NicolaIDES, os de Britto, a linha do NUPPIB. E seja honesto sobre o escopo do seu modelo. Se ele só funciona bem em uma variedade, diga isso claramente. Modelos que fingem ser neutros são os mais perigosos porque escondem seu viés.