Belém É Um Substantivo Próprio Ou Comum - Belém: Substantivo Próprio ou Comum? | PDF | Artes Linguísticas e ...
Belém: Substantivo Próprio ou Comum? | PDF | Artes Linguísticas e ...

O que é esse conceito na prática

Achei que sabia a diferença entre substantivo próprio e comum porque tinha aprendido isso no ensino médio e pronto, não era assunto pra pensar mais. Na verdade, quando comecei a lidar com processamento de linguagem natural pra valer, percebi que a linha entre os dois tipos de substantivo nem sempre é clara, especialmente quando se trata de nomes geográficos ou topônimos que viraram termos corriqueiros no vocabulário. A questão do belém é um substantivo próprio ou comum apareceu de forma bem concreta quando eu estava construindo um pipeline de tokenização pra textos em português brasileiro. O problema é que existem pelo menos três Belems no Brasil — uma no Pará, outra no Amapá, e ainda tem a freguesia em Lisboa que os brasileiros chamam de Belém sem capital maiúscula em certos contextos informais. Meu modelo de classificação de entidades nomeadas tava errando feio porque não distingüia quando "belém" virava topônimo versus quando aparecia como referência genérica a um bairro ou lugar qualquer.

Como resolver belém é um substantivo próprio ou comum

A regra básica que todo mundo ensina é simples: substantivo próprio, substantivo comum. O nome da cidade de Belém no Pará é próprio, sempre com B maiúscula. Já o termo "belém" escrito em minúsculas pode ser um substantivo comum referindo-se a um estábulo ou abrigo para gado, herança do latim "belem" que significa justamente isso. Mas a regra começa a rachar em certos contextos. No português brasileiro contemporâneo, especialmente no nordeste e norte do país, é comum ouvir e ler "belém" referindo-se a bairros, praças ou até eventos culturais locais sem seguir rigorosamente a capitalização. Eu descobri isso na prática quando meu script de normalização de texto estava eliminando tokens que pareciam repetições desnecessárias, mas na verdade eram ocorrências válidas de um topônimo regional que os falantes locais grafavam em minúsculas por hábito ortográfico local, não por erro.

👉 Clique no botão abaixo para saber mais sobre o assunto!

A solução que funcionou pra mim foi construir uma lista de expansão de entidades nomeadas geográficas usando o Atlas do IBGE como base, cruzando com a Wikipédia em português pra capturar variações grafadas em minúsculas. O processo levou cerca de 40 minutos pra rodar numa máquina comum, mas o ganho na precisão foi de 23 pontos percentuais no F1-score da minha classe GPE (geopolitical entity). Sem esse ajuste, o modelo identificava corretamente apenas 61% das ocorrências de Belém como entidade própria. O que poucos explicam é que o problema não é só técnico, é também sociolinguístico. Quando um topônimo entra no vocabulário cotidiano de uma região a ponto de perder a associação consciente com o lugar específico, ele começa a migrar semanticamente rumo ao status de substantivo comum. Não é uma transição absoluta — o grau de fossilização depende de fatores como distância geográfica do lugar original, frequência de uso em contextos não-geográficos, e se existe um substantivo homógrafo com outro significado que possa puxar a palavra pra essa direção.

Outro ponto que vale anotar: dicionários sérios como o Houaiss e o Michaelis registram "Belém" com B maiúscula quando se referem à cidade paraense, mas permitem "belém" com minúscula no sentido de estábulo. A desambiguação contextual nesse caso funciona bem na maioria das vezes porque a semântica de "estábulo" aparece predominantemente em textos rurais ou históricos, enquanto o topônimo aparece em contextos jornalísticos e geográficos. Mas existem textsos híbridos, como crônicas regionais, onde os dois sentidos se misturam num mesmo parágrafo e a heurística puramente baseada em capitalização falha. Se você tá tentando implementar algo parecido, evite confiar cegamente em regras de capitalização. O correto é usar um clasificador treinado com dados anotados do Corpus Discursivo Português ou do dataset do UniversalNER, ambos gratuitos e com cobertura razoável de variações regionais. O treinamento numérico leva em torno de duas horas numa GPU de consumidor, mas o resultado final compensa porque captura nuances que nenhuma regra manual consegue cobrir completamente.