O Que É Media Mediana E Moda - Média, Mediana e Moda: 3 M’s que você precisa saber para o ENEM
Média, Mediana e Moda: 3 M’s que você precisa saber para o ENEM

Medidas de tendência central na prática

Quando você olha para um conjunto de dados e quer resumir ele em um número só, as três ferramentas que vão aparecer em qualquer planilha ou relatório são a média, a mediana e a moda. Todo mundo aprende a fórmula no ensino médio e ach que sabe usar. O problema é que no dia a real, com dados desorganizados e distribuições distorcidas, essas medidas se comportam de formas bem diferentes do que o textbook diz.

O que é média mediana e moda de verdade

A média é simplesmente a soma de todos os valores dividida pela quantidade de observações. Esse é o cálculo mais básico da estatística descritiva e também o mais sensível a outliers. Se você tem uma amostra de salários e um valor extremadamente alto entra na base, a média sobe e deixa de representar a realidade da maioria. Eu lidava com isso há alguns anos analisando dados de receita de usuários em um produto digital. O dataset tinha uns 40 mil registros de churn, mas cerca de 2% dos usuários eram enterprise com contratos muito acima da média. A média de tempo de permanência ficou inflacionada em 35 dias, enquanto 90% dos clientes tinham ficado menos de 60 dias. A solução que eu usei foi calcular a média depois de aplicar winsorização truncada nos 2,5% superiores e inferiores, removendo ou limitando os valores extremos. Isso reduziu o viés para algo próximo de 8 dias, bem mais realista. A mediana é o valor que divide o conjunto ordenado ao meio. Metade dos dados fica acima, metade abaixo. Ela não carrega o mesmo problema da média porque um outlier isolado não consegue empurrá-la para longe. Em distribuições assimétricas, como renda familiar ou tempo de resposta de servidores, a mediana costuma ser muito mais informativa. O trade-off é que ela perde informação sobre a magnitude dos valores. Dois datasets podem ter a mesma mediana mas estruturas completamente diferentes. Já a moda é o valor mais frequente no conjunto. Parece simples demais para ter utilidade, mas em dados categóricos ou discretos ela é imbatível. Produtos mais vendidos, faixas etárias predominantes, estados mais frequentes — tudo isso se resolve com a moda sem precisar de cálculos complexos. O problema é que conjuntos multimodais criam ambiguidade. Quando há dois ou mais valores com frequência igual, a moda perde sentido analítico e você precisa decidir se reporta todos ou recorre a outra medida.

Quando cada medida falha e o que fazer

Dados com distribuição multimodal são onde muita gente erra. Você calcula a média e entrega um número que não existe no dataset. Se você está estudando a duração de call centers e tem dois picos — um em 3 minutos para dúvidas simples e outro em 18 minutos para reclamações —, a média pode cair em torno de 10 minutos, um tempo que ninguém realmente experimenta. Nesse caso, a mediana ou a análise bimodal segmentada é o caminho. Outro cenário comum é dados censurados. Quando parte da informação não está disponível porque o evento ainda não ocorreu, como tempo até falha de equipamentos que ainda não quebraram, a média arbitra um valor que pode ser completamente enganoso. O Kaplan-Meier estima funções de sobrevivência e lida com censura de forma adequada. É um passo além da média tradicional, mas é o mínimo que se espera de quem trabalha com dados reais. Para dados discretos como contagem de erros por lote, a moda pode ser a medida mais honesta, especialmente quando a distribuição é fortemente assimétrica à direita. Mas se a variável é contínua e todos os valores são únicos, a moda simplesmente não existe. Nesses casos, você precisa agrupar em bins ou usar densidade kernel, o que adiciona complexidade mas recupera a informação.

Implementação prática

Em Python, o cálculo das três medidas é direto com a biblioteca NumPy ou Pandas. Um exemplo rápido com dados do mundo real:

import numpy as np import pandas as pd dados = pd.read_csv('dataset_real.csv') media = dados['variavel'].mean() mediana = dados['variavel'].median() moda = dados['variavel'].mode()[0] print(media, mediana, moda)

👉 Clique no botão abaixo para saber mais sobre o assunto!

Se quiser lidar com multimodalidade na moda, o scipy.stats.mode com keep=all retorna todos os valores modais. Para dados com outliers pesados, o scipy.stats.trim_mean corta uma fração das pontas antes de calcular a média. No R, o base mean, median e mode funcionam de forma similar, mas o mode do R na verdade retorna o tipo da variável, então para moda você precisa usar table seguido de which.max. Para quem trabalha com Excel, as funções =MÉDIA(), =MEDIANA() e =MODA.UNICA() cobrem o essencial. A partir da versão 2019, a MODA.N retorna todas as modas quando existem múltiplos valores com mesma frequência.

Dicas que ninguém conta

Sempre visualise antes de confiar nas medidas. Um histograma ou boxplot leva 30 segundos e evita que você apresente uma média que não representa ninguém. Distribuições assimétricas exigem relato da mediana junto com a média, nunca apenas uma delas. E em datasets grandes com muitos zeros, como taxa de conversão de campanhas de marketing, a moda pode ser zero simplesmente porque a maioria não converteu — isso é informação válida, não ruído. A principal limitação que as três compartilham é que nenhuma delas captura dispersão. Uma média de 50 com desvio padrão de 5 conta uma história completamente diferente de uma média de 50 com desvio padrão de 25. Sempre reporte alongside ao menos o desvio padrão ou o intervalo interquartil, senão você está entregando meia informação.