A frequência das consoantes no português e o que ela revela na prática
Se você já viu uma análise estatística de texto em português, provavelmente notou que certas letras aparecem muito mais do que outras. Não é coincidência. É consequência da estrutura morfológica e dos padrões de frequência do idioma. A pergunta qual consoante mais usada na lingua portuguesa aparece com frequência em fóruns, listas de discussão e até em dúvidas de iniciantes em criptografia, processamento de linguagem natural e digitação. A resposta direta é: a letra S.
qual consoante mais usada na lingua portuguesa
O S ocupa consistentemente a primeira posição entre as consoantes em praticamente todas as análises de frequência lexical do português brasileiro e europeu. Dados de corpora como o Corpus do Português, o CETEP e estatísticas de digitação mostram o S variando entre 6% e 7,5% da ocorrência total de letras, dependendo do recorte textual. Em textos mais formais e jurídicos, a porcentagem tende a ser ainda maior devido à frequência de sufixos como -ção, -mento e -mente, que embora contenham outras consoantes, muitas vezes aparecem em com artigos e preposições que encerram S final. A diferença para a segunda colocada, o R, costuma ficar na casa de 1 a 1,5 ponto percentual. O ranking completo costuma ficar assim, em ordem decrescente: S, R, N, L, M, P, T, C, D, B, F, V, J, G, X, Q, Z. As três últimas — X, Q, Z — são sistematicamente as menos frequentes. O H é particularmente curioso porque, apesar de estar no alfabeto, não representa fonema próprio no português padrão e só aparece em posições específicas (início de palavras como "homem", "hoje", ou em dígrafos como "ch", "lh", "nh"). Em contagens estritas de letra, ele entra na estatística, mas seu peso é marginal.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Eu já fiz contagem manual de frequência para validar dados de um sistema de predictive text em português há alguns anos. O problema é que a literatura oferece tabelas genéricas e elas nem sempre refletem oRegister que você está estudando. Me deparei com um corpus de transcrições de oral em português brasileiro onde o N aparecia desproporcionalmente mais do que o esperado, simplesmente porque os falantes usavam constantemente formas como "pra", "pro", "tô", "ta" — tudo com nasalização e redução de consoantes finais. A tabela padrão dizia que o S deveria liderar com folga, mas no falado espontâneo a disputa com o R e o N fica muito mais aberta. Minha solução foi filtrar o corpus em duas camadas: uma para texto escrito formal e outra para fala coloquial, e só então cruzar os dados. O S ainda venceu, mas a margem encolheu de 6,8% para cerca de 4,9% noRegister falado. O que pouca gente leva em conta é que a frequência de consoantes não é uniforme entre variantes do português. No português europeu, por exemplo, a presença de ditongos nasais e a pronúncia mais fechada de certaines vogais alteram levemente a distribuição. Em Angola e Moçambique, corpus com maior influência de línguas bantu podem mostrar frequências divergentes, especialmente em consoantes como o K e o G, que em certos contextos lexicais ganham mais relevância. Se o seu trabalho envolve normalização ortográfica ou modelagem estatística multirregistral, usar uma tabela única de frequência para todo o português é uma simplificação perigosa.
Outro ponto que ninguém menciona com a devida clareza: a frequência de consoantes muda radicalmente quando se usa teclado físico versus digitação por swipe ou reconhecimento de voz. Em teclados QWERTY e ABNT2, o S é facilmente acessível pelo dedo indicador esquerdo na posição home, e essa proximidade biomecânica reforça ainda mais sua dominância estatística. Já o Z, que fica no canto inferior direito em QWERTY e exige movimento do dedo mindinho, tende a ser ainda mais sub-representado em textos digitados do que em textos escritos à mão. Esse viés de modalidade é importante se você estiver construindo um modelo de linguagem ou calculando entropia informacional do português. Uma coisa que muitos tratadores de dados esquecem é que a frequência de consoantes é diferente da frequência de fonemas. O S, por exemplo, pode representar quatro fonemas distintos no português: /s/ intervocálico em "casa", /z/ em "roso", // em "chave" (embora aqui seja grafado com CH, não S), e /s/ pós-vocálico em "ossos". Então quando você conta letras, está contando grafemas, não sons. Para tarefas de fonotática ou fusão sílabica, esse distinction é relevante. A consoante mais frequente fonologicamente, por sinal, costuma ser o // ou /r/, dependendo do dialecto, o que mostra que a resposta gráfica e a resposta fonológica podem apontar para lugares diferentes.
Se o seu objetivo é apenas saber a resposta para uma curiosidade ou para preencher uma aba em um relatório rápido, o S é a resposta segura. Se você precisa de precisão analítica, o ideal é especificar oRegister (escrito ou falado), a variante (brasileiro, europeu, africano) e o tamanho do corpus. Sem esses três parâmetros, qualquer número que aparecerá na literatura é uma aproximação útil, mas não definitiva. E isso vale tanto para a pergunta inicial quanto para qualquer análise subsequente de frequência letteral em português.