Montando uma tabela de frequência na prática
O processo começa quando você tem um conjunto de dados brutos e precisa resumí-lo para análise ou apresentação. Você pega a lista de valores, ordena do menor para o maior e conta quantas vezes cada valor ou intervalo aparece. A partir daí, preenche as colunas e aplica os cálculos necessários. É isso que constitui uma tabela de frequência estatística em sua forma mais básica. Na prática, a montagem manual funciona bem para conjuntos pequenos — digamos, até 50 observações. Para volumes maiores, o erro humano se acumula rápido. Meu fluxo habitual é usar uma planilha. Coloco os dados brutos na coluna A, uso a função CONT.SE ou um recurso de consolidar para contar as ocorrências, e monto as colunas complementares automaticamente.
Vou explicar a estrutura completa antes de entrar nos detalhes, porque a ordem dos elementos importa mais do que muitos manuais ensinam.
O que compõe a tabela de frequência estatística
Cada coluna da tabela tem uma função específica e o nome varia conforme a região, então vou usar a nomenclatura mais comum no Brasil: Xi — os valores individuais ou os pontos médios dos intervalos de classe. É a primeira coluna. Representa a variável em si.
Fi — frequência absoluta. Conta quantas vezes cada Xi aparece no seu banco de dados. É o dado mais direto da tabela. Fa — frequência acumulada. Some as frequências absolutas progressivamente. A última linha sempre vai coincidir com o total de observações. Se não coincidir, você cometeu um erro de soma em algum ponto intermediário.
fi (letra minúscula) — frequência relativa. Divide cada Fi pelo total de observações. O resultado é um número entre 0 e 1. Alguns profissionais multiplicam por 100 e apresentam em percentual, o que não altera o cálculo mas muda a leitura visual. Fal — frequência relativa acumulada. Similar à Fa, mas aplicada aos valores relativos. Utile quando você quer saber qual proporção do total está contida até determinado ponto.
Uma coluna extra que muita gente esquece: hf — a amplitude relativa de cada intervalo de classe. Calculada dividindo a amplitude do intervalo (P) pelo ponto médio. Não é obrigatória, mas economiza cálculos posteriores quando você vai construir um histograma.
Distribuição agrupada versus desagrupada
Aqui está onde a maioria dos iniciantes trava. Dados contínuos precisam ser agrupados em intervalos de classe. Dados discretos, como quantidade de filhos ou número de defeitos em uma linha de produção, funcionam perfeitamente sem agrupamento. Para agrupar, você precisa definir o número de classes. A regra de Sturges é o ponto de partida padrão: k = 1 + 3,322 × log(n), onde n é o número de observações. Para 100 dados, isso dá aproximadamente 8 classes. Para 500 dados, cerca de 10 classes. Não é uma lei — é uma sugestão que funciona na maioria dos casos práticos.
A amplitude do intervalo (P) se calcula subtraindo o valor máximo do mínimo e dividindo pelo número de classes desejado. Depois de arredondar, verifique se todos os intervalos têm a mesma largura. Se tiverem larguras diferentes, suas frequências relativas não serão comparáveis visualmente e o histograma vai distorcer a distribuição.
Um problema real que encontrei e como resolvi
Trabalhava com um conjunto de tempos de atendimento em uma central de saúde, com cerca de 340 observações. Ao montar a tabela com 9 classes usando Sturges, identifiquei que 23 registros (cerca de 7%) tinham valores exatamente nas fronteiras entre dois intervalos — por exemplo, 45 minutos, que era o limite superior de uma classe e o inferior da seguinte. A convenção brasileira padrão é fechar à esquerda e abrir à direita: [a, b). Isso significa que o valor 45 entraria na classe superior, não na inferior. Mas nem todos os softwares aplicam essa convenção automaticamente. O Excel, por exemplo, exige que você monte os limites explicitamente e use a função FRQUIXOA, que segue outra lógica de fronteira.
Minha solução foi criar uma coluna auxiliar com a função SE, atribuindo manualmente cada valor ao intervalo correto baseado na convenção [a, b), e só então aplicar a contagem de frequência. Isso garantiu que nenhum registro ficasse ambíguo. Levei cerca de 20 minutos extras no processo, mas evitou distorções que teriam comprometido toda a análise subsequente. O mesmo problema aparece com dados duplamente registrados — quando o mesmo valor aparece nos limites de duas classes consecutivas. Sempre verifique isso antes de fechar a tabela. Um simples CONT.SE na borda entre classes resolve em segundos.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Pegadinhas que ninguém conta
Primeiro: frequência relativa acumulada não é a mesma coisa que porcentagem acumulada, embora numericamente sejam proporcionais. Se você apresentar dados para um público não técnico, usar percentual é mais claro. Se for para estatísticos, frequência relativa (0 a 1) é o padrão esperado. Segundo: intervalos de classe abertos — aqueles que só têm limite superior (ex: "mais de 80 anos") ou inferior — não permitem calcular ponto médio corretamente. Se o seu dado tem cauda extrema assim, considere recodificar esse intervalo ou usar mediana e quartis em vez de média e desvio padrão na análise descritiva subsequente.
Terceiro: ao usar a regra de Sturges com amostras pequenas (menos de 30 observações), o número de classes resultante pode ser tão baixo a ponto de esconder a estrutura da distribuição. Nesse caso, use a regra de Scott ou simplementepreste-se os dados brutos sem agrupamento.
Quando a tabela de frequência não serve
A tabela é ótima para síntese e para dados univariados. Ela falha completamente quando você precisa entender relações entre variáveis — aí precisa de uma tabela de contingência ou de uma matriz de correlação. Também perde utilidade com variáveis contínuas de alta resolução (como medidas de laboratório com três casas decimais), onde o agrupamento em classes apaga padrões que poderiam ser visíveis em um gráfico de densidade ou em um boxplot. Para dados ordinal ou categóricos nominais, a tabela funciona bem, mas a ordem das categorias deve ser definida antes da contagem, não depois. Colocar categorias em ordem alfabética quando a variável tem uma lógica intrínseca (como nível de escolaridade ou estágio de doença) gera tabelas que confundem mais do que esclarecem.
Cálculo passo a passo com exemplo real
Vamos supor que você tenha estas 15 notas de alunos: 3, 5, 7, 4, 6, 8, 5, 7, 3, 6, 5, 4, 7, 6, 5
Valores únicos: 3, 4, 5, 6, 7, 8 Frequências absolutas: 3 aparece 2 vezes, 4 aparece 2 vezes, 5 aparece 4 vezes, 6 aparece 3 vezes, 7 aparece 3 vezes, 8 aparece 1 vez. Total = 15.
Frequências relativas: 2/15 = 0,133; 2/15 = 0,133; 4/15 = 0,267; 3/15 = 0,200; 3/15 = 0,200; 1/15 = 0,067. A soma das relativas deve dar 1,000. Se der 0,999 ou 1,001 por arredondamento, está dentro da tolerância aceitável. Frequência acumulada: 2, 4, 8, 11, 14, 15. Verificação: o último valor deve igualar o total de observações.
Frequência relativa acumulada: 0,133, 0,267, 0,533, 0,733, 0,933, 1,000.
Montando a tabela de frequência estatística no Excel
Se seus dados estão na coluna A (A2:A101 para 100 observações), o caminho mais rápido é: 1. Na coluna B, liste os valores únicos com DATASCOLAR > Remover Duplicatas ou use uma tabela dinâmica.
2. Na coluna C, use =CONT.SE(A:A; B2) para copiar para baixo. 3. Na coluna D, =C2/SOMA($C$2:$C$100) para frequência relativa. Arraste para baixo.
4. Na coluna E, =SOMASE($C$2:C2; ">0") para acumulado. Ou simplesmente =SOMA($C$2:C2) se já estiver ordenado. Para dados agrupados em intervalos, a função FRQUIXOA do Analyse ToolPak do Excel automatiza tudo, mas exige que os limites das classes estejam em uma coluna separada. O resultado inclui tanto frequência absoluta quanto relativa, mas não calcula a acumulada automaticamente — você precisa fazer isso manualmente nas colunas seguintes.
No R, o comando é simplesmente table() para dados brutos e cut() combinado com table() para dados agrupados. No Python, pandas oferece pd.cut() para intervalos e value_counts() para frequência absoluta. Ambas as bibliotecas produzem resultados idênticos aos manuais quando configuradas corretamente. O que mais gera erro na prática não é o cálculo em si — é a interpretação. Uma tabela bem construída mostra a distribuição, mas não diz se ela é simétrica, bimodal ou tendenciosa. Para isso, você precisa cruzar a tabela com um histograma ou com medidas de tendência central. A tabela é o primeiro passo, não o último.