Quando o substantivo próprio vira dor de cabeça
Estava revisando um texto técnico sobre localização de software quando percebi que uma string de interface continha um nome próprio que precisava ser mantido em caixa alta — mas a ferramenta de extração automática estava convergendo tudo para minúsculas. O problema não era só estético, era funcional. Nomes como GitHub, iOS, Python ou JavaScript têm grafia fixa reconhecida pelos desenvolvedores. Se o tradutor ou o parser decide "corrigir" para github, python, javascript, isso quebra buscas em código, links quebram e a consistência do produto cai. Isso me levou a estudar como tratar substantivo próprio em fluxos de tradução automatizada e normalização textual. A questão parece simples — você identifica, preserva, ponto — mas na prática esbarra em regras gramaticais, convenções tipográficas e casos limítrofes que quase todo mundo subestima.
O que é substantivo próprio e onde termina a zona cinzenta
Um substantivo próprio é um nome que identifica um ser, entidade ou lugar específico, e em português se caracteriza graficamente pela letra maiúscula inicial. Isso é a definição de livro didático. O que os livros não contam é que a fronteira entre substantivo próprio e comum muda conforme o uso e o tempo. Palavras como internet, google, xerox e novembro já foram nomes próprios e hoje são comuns em muitos contextos. Na minha experiência com normalização de textos técnicos, o que mais causa divergência é exatamente esse terreno de transição. Eu configurei um script em Python usando regex com lista branca de palavras-chave para preservar maiúsculas durante pipelines de tradução. A lista continha nomes de tecnologias, produtos e pessoas. Funcionou bem até aparecer um cliente que insistia em grafar facebook e linkedin em minúsculas, argumento de que o uso cotidiano no Brasil havia consagrado essa forma. Tecnicamente, o substantivo próprio Facebook e LinkedIn ainda exige maiúscula segundo a norma culta, mas em ambientes de conteúdo digital a variação é real. Decidi deixar a decisão com o revisor humano nesses casos, porque o custo de impor a norma ultrapassa o ganho.
Como identificar substantivo próprio em fluxos de produção
A abordagem mais direta usa dicionários estáticos combinados com regras de capitalização. Você carrega uma lista de nomes próprios conhecidos, aplica padrões como "mantenha maiúscula se a palavra for reconhecida no glossário" e deixa o restante seguir a capitalização padrão do idioma de destino. O glossário precisa ser atualizado regularmente, senão nomes próprios recentes entram como comuns e são tratados erroneamente. Em projetos que trabalhei, a média de atualização mensal consumia cerca de trinta minutos de manutenção. Uma alternativa mais sofisticada é usar modelos de reconhecimento de entidades nomeadas (NER). Ferramentas como spaCy, Transformers ou até APIs de tradução neural identificam automaticamente pessoas, organizações, locais e marcas. Isso reduz a dependência de listas manuais, mas introduz seu próprio conjunto de problemas. Modelos NER genéricos confundem frequentemente nomes próprios com substantivos comuns em contextos técnicos. Por exemplo, um modelo pode tratar Apple como marca quando se refere à fruta e não à empresa, dependendo da vizinhança textual. Eu adaptei um pipeline híbrido: NER para proposta de capitalização e glossário estático como camada de validação. O resultado foi uma taxa de precisão superior a ninety-two por cento em meus testes, o que considero aceitável para produção.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Se você trabalha com português brasileiro e português europeu, há uma nuance adicional importante. A norma culta brasileira segue o Acordo Ortográfico de 1990, que manteve a capitalização de nomes próprios, mas algumas publicações jornalísticas brasileiras adotam convenções diferentes, grafando menosmaiúsculas do que o padrão formal exige. Em textos acadêmicos e técnicos, a exigência é mais rígida. Em newsletters e redes sociais, a flexibilidade é maior. Conhecimento do público-alvo define qual convenção aplicar, e o erro aqui é tratar todos os domínios como iguais.
Limitações e cenários onde a abordagem falha
Nenhuma solução automatizada resolve substantivo próprio de forma perfeita. Modelos NER falham em textos curtos ou com contexto ambíguo. Glossários estáticos ficam desatualizados rapidamente. Regras heurísticas baseadas em posição não funcionam bem em línguas com ordem sintática diferente. O custo-benefício de cada método depende do volume e da variabilidade do corpus. Para textos com alta densidade de nomes próprios conhecidos, como revistas especializadas, glossários estáticos são suficientes e mais baratos. Para textos abertos com neologismos e nomes novos frequentes, investir em NER refinado compensa. Outro ponto cego é a variação dialetal. Nomes próprios de lugares no Brasil podem ter grafias diferentes das versões em Portugal e vice-versa. São Paulo mantém a capitalização em ambos, mas topônimos indígenas e africanos sofrem variação gráfica significativa. Se seu fluxo de produção atende múltiplas variantes do português, trate substantivo próprio como um caso de localização, não de correção ortográfica.
Workflow prático que eu uso hoje
No projeto atual, o pipeline funciona assim. Primeiro, extrai-se todo o conteúdo textual e aplica-se NER com um modelo fine-tuned em domínio técnico. Segundo, cruza-se a saída com um glossário interno de nomes próprios validados. Terceiro, aplica-se regras de capitalização baseadas no idioma de destino. Quarto, revisores humanos atuam apenas nos casos de baixa confiança do modelo, que costumam representar menos de oito por cento do total. Esse corte reduziu o tempo de revisão manual de duas horas para aproximadamente quinze minutos por documento de mil palavras, o que considero um ganho significativo. Se você está começando agora, não tente construir o sistema do zero. Ferramentas como o corretor do LibreOffice com personalização de glossário, ou extensões de VS Code que aplicam regras de capitalização, dão resultado razoável com esforço baixo. Quando o volume ou a complexidade aumentar, aí sim vale a pena migrar para um pipeline NER com glossário.