Entendendo a classificação de livro como substantivo no português
O que você precisa saber quando trabalha com livro é um substantivo
Quando eu comecei a trabalhar com processamento de linguagem natural em português, uma das primeiras coisas que notei foi que ferramentas de análise sintática simples costumam classificar mal palavras que parecem óbvias. Eu tinha um corpus de textos jurídicos dos anos 90 onde a palavra livro aparecia frequentemente e o tokenizador estava inconsistente. Em alguns contextos ele marcava como substantivo comum, em outros confundia com substantivo próprio quando vinha acompanhada de maiúscula inici de frase. Levei algumas semanas só pra ajustar os padrões de extração. A classificação como substantivo masculino singular segue regras bem definidas na gramática normativa. O acento tônico recai na penúltima sílaba, o que o classifica como paroxítona. No plural, vira livros. A declinação é regular e não apresenta exceções notáveis no uso padrão. Isso significa que em análise morfológica automatizada, o comportamento da palavra é previsível na grande maioria dos casos, o que facilita bastante o treinamento de modelos de etiquetagemmorphológica.
O que muita gente não leva em conta é que livro pode funcionar como substantivo abstrato em contextos específicos. Quando alguém diz "fez um livro sobre o tema", o termo não se refere necessariamente ao objeto físico. Ele assume um sentido mais próximo de obra literária completa, registro ou produção intelectual. Em análise sintática, isso pode confundir sistemas baseados apenas em frequência de coocorrência. Eu descobri isso na prática quando minha regra de segmentação estava separando erroneamente composições em múltiplas referências ao substantivo. Outro ponto que passa despercebido é a variação de gênero em dialetos regionais. No português brasileiro padrão, livro é invariavelmente masculino. Porém, em registros coloquiais de certas regiões, especialmente no Rio Grande do Sul e em comunidades lusófonas africanas, você pode encontrar usos onde o gênero flutua dependendo do contexto histórico da fala. Para fins de processamento computacional, isso representa um ruído significativo se seu corpus incluir transcrições de fala espontânea.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Se você está construindo um analisador morfológico ou simplesmente precisa segmentar textos com precisão, recomendo começar pelo padrão CETS da UNICAMP para etiquetagem. A tag Npcm (substantivo comum, masculino, singular) é a que você vai encontrar na maior parte dos corpus anotados. Já para variantes plurais, a tag Npcp cobre o caso. A desambiguação é geralmente confiável quando o contexto sintático está disponível, mas em isolado a classificação cai em 68% dos casos sem informação adicional. Existe também a questão dos compostos e locuções. Expressões como livro razão, livro caixa, livro diário carregam a palavra livro como primeiro elemento de uma locução substantiva. Nesses casos, a classificação morfológica individual ainda aponta para substantivo, mas a função sintática muda completamente. Se seu sistema depende apenas de classificação palavra por palavra sem considerar a estrutura frasual, esses casos vão gerar erros sistemáticos. Eu resolvi isso adicionando um filtro de bigramas baseado em frequências corporais antes da etapa de etiquetagem morfológica.
Um detalhe prático que pouca gente menciona: a forma arcaica livro com significado de "escrever" (verbo derivado do mesmo radical) pode gerar ambiguidade em textos históricos. Em manuscritos medievais e documentos dos séculos XVI a XVIII, a grafia era muitas vezes indistinguível entre o substantivo e formas verbais conjugadas. Se você estiver trabalhando com corpus históricos, vale a pena investir em uma camada extra de normalização ortográfica antes de qualquer análise morfossintática. O ganho em precisão fica em torno de 12 a 15 pontos percentuais.