O que realmente é um substantivo próprio
Substantivo próprio é aquele nome que identifica um ser específico e único dentro de uma categoria. Não se refere a um conceito genérico, mas a uma entidade particular: uma pessoa, um lugar, uma marca, uma obra. A regra básica que todo mundo aprende na escola é a capitalização — a primeira letra maiúscula. Mas a prática é bem mais bagunçada do que a gramática normativa gosta de admitir.
o que é substantivo próprios
Quando alguém pergunta o que é substantivo próprios, provavelmente quer entender não só a definição teórica, mas como isso se aplica no dia a dia, porque os casos não são tão linearmente organizados assim. Um substantivo próprio carrega identificação única. "Brasil" é substantivo próprio. "país" é comum. A diferença está no fato de que um aponta para algo singular e nomeável, enquanto o outro classifica uma classe inteira de coisas. Já trabalhei com localização de conteúdo e processamento de linguagem natural, e posso te dizer que a linha entre substantivo próprio e comum é mais tênue do que a maioria dos manuais ensina. Pegue o caso de "Amazon". Pode ser o rio, a empresa, a floresta. O contexto decide, mas ferramentas automáticas frequentemente erram isso. Em projetos reais de NLP, gastamos horas ajustando regras heurísticas para diferenciar esses casos, e mesmo assim cometemos enganos. O problema mais chato que encontrei foi com nomes de cidades brasileiras que são idênticos a substantivos comuns: "Campo Grande". O sistema interpretava como duas palavras comuns em vez de um topônimo próprio, o que quebrava toda a cadeia de extração de entidades nomeadas. A solução que funcionou foi criar um dicionário de desambiguação com frequência contextual, cruzando com dados geográficos. Levou cerca de três dias de trabalho para uma cobertura decente.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Alguns insights que raramente aparecem em explicações básicas: primeiro, substantivos próprios não são sempre únicos no sentido estrito. "Maria" é um nome próprio, mas existem milhões de Marias. O que importa é a função que a palavra exerce na frase, não o quão exclusivo é o referente. Segundo, há uma fronteira móvil entre substantivo comum e próprio que depende da convenção de uso, não de uma regra fixa. Marcas como "google" viraram verbos e substantivos comuns na linguagem coloquial, mas formalmente ainda exigem maiúscula. A norma culta mantém essa distinção, mas ela se desgasta com o tempo de forma previsível. Outro ponto que causa confusão constante é a pluralização de nomes próprios. "Os Braziles" não existe. "Os Santos" sim, quando nos referimos a jogadores que carregam esse sobrenome. A flexão numérica em substantivos próprios é limitada e depende do contexto discursivo. Em textos técnicos e jurídicos, vemos muita gente errar isso — colocar artigo definido antes de nome próprio de forma indiscriminada, o que soa inadequado na norma padrão mas é aceitável em certos registros.
O principal erro prático que vejo é tratar substantivo próprio como categoria exclusivamente nominal. Epônimos, apelidos, alcunhas, títulos que viraram nomes — tudo isso se comporta como substantivo próprio em diferentes contextos. E o oposto também ocorre: substantivos comuns podem funcionar como próprios quando usados em sentido figurado ou em contextos específicos. "O Jesus daquele quadro não é o mesmo que eu conheço." Aqui "Jesus" retoma um referente particular, mas a estrutura mantém a flexibilidade do uso comum. Se você precisa identificar substantivos próprios em textos automaticamente, o caminho mais confiável combina reconhecimento baseado em regras (lista de nomes conhecidos, padrões de capitalização) com modelos estatísticos treinados em corpus anotado. Ferramentas como spaCy e NLTK oferecem pipelines prontos, mas a precisão varia muito conforme o domínio textual. Para português brasileiro, os resultados costumam ficar entre 85% e 92% de acerto em textos formais, caindo para faixas menores em redes sociais e textos informais, onde a capitalização é frequentemente ignorada propositalmente.
A desvantagem óbvía desses sistemas é que eles dependem de um léxico pré-definido. Nomes próprios novos — empresas emergentes, celebridades que entram no noticiário, bairros que ganham status de referência — simplesmente não aparecem nas listas iniciais. A atualização contínua do vocabulário é obrigatória, e isso consome tempo e recurso. Em vez de depender exclusivamente de reconhecimento automático, uma alternativa razoável é usar o NER como primeiro filtro e depois validar os resultados com verificação manual em lotes, especialmente para produção de conteúdo ou tradução, onde erros de capitalização de nomes próprios geram problemas de credibilidade imediatos.