Medidas de tendência central na prática
Quando você olha para um conjunto de dados e quer resumir ele em um número só, as três ferramentas que vão aparecer em qualquer planilha ou relatório são a média, a mediana e a moda. Todo mundo aprende a fórmula no ensino médio e ach que sabe usar. O problema é que no dia a real, com dados desorganizados e distribuições distorcidas, essas medidas se comportam de formas bem diferentes do que o textbook diz.O que é média mediana e moda de verdade
A média é simplesmente a soma de todos os valores dividida pela quantidade de observações. Esse é o cálculo mais básico da estatística descritiva e também o mais sensível a outliers. Se você tem uma amostra de salários e um valor extremadamente alto entra na base, a média sobe e deixa de representar a realidade da maioria. Eu lidava com isso há alguns anos analisando dados de receita de usuários em um produto digital. O dataset tinha uns 40 mil registros de churn, mas cerca de 2% dos usuários eram enterprise com contratos muito acima da média. A média de tempo de permanência ficou inflacionada em 35 dias, enquanto 90% dos clientes tinham ficado menos de 60 dias. A solução que eu usei foi calcular a média depois de aplicar winsorização truncada nos 2,5% superiores e inferiores, removendo ou limitando os valores extremos. Isso reduziu o viés para algo próximo de 8 dias, bem mais realista. A mediana é o valor que divide o conjunto ordenado ao meio. Metade dos dados fica acima, metade abaixo. Ela não carrega o mesmo problema da média porque um outlier isolado não consegue empurrá-la para longe. Em distribuições assimétricas, como renda familiar ou tempo de resposta de servidores, a mediana costuma ser muito mais informativa. O trade-off é que ela perde informação sobre a magnitude dos valores. Dois datasets podem ter a mesma mediana mas estruturas completamente diferentes. Já a moda é o valor mais frequente no conjunto. Parece simples demais para ter utilidade, mas em dados categóricos ou discretos ela é imbatível. Produtos mais vendidos, faixas etárias predominantes, estados mais frequentes — tudo isso se resolve com a moda sem precisar de cálculos complexos. O problema é que conjuntos multimodais criam ambiguidade. Quando há dois ou mais valores com frequência igual, a moda perde sentido analítico e você precisa decidir se reporta todos ou recorre a outra medida.Quando cada medida falha e o que fazer
Dados com distribuição multimodal são onde muita gente erra. Você calcula a média e entrega um número que não existe no dataset. Se você está estudando a duração de call centers e tem dois picos — um em 3 minutos para dúvidas simples e outro em 18 minutos para reclamações —, a média pode cair em torno de 10 minutos, um tempo que ninguém realmente experimenta. Nesse caso, a mediana ou a análise bimodal segmentada é o caminho. Outro cenário comum é dados censurados. Quando parte da informação não está disponível porque o evento ainda não ocorreu, como tempo até falha de equipamentos que ainda não quebraram, a média arbitra um valor que pode ser completamente enganoso. O Kaplan-Meier estima funções de sobrevivência e lida com censura de forma adequada. É um passo além da média tradicional, mas é o mínimo que se espera de quem trabalha com dados reais. Para dados discretos como contagem de erros por lote, a moda pode ser a medida mais honesta, especialmente quando a distribuição é fortemente assimétrica à direita. Mas se a variável é contínua e todos os valores são únicos, a moda simplesmente não existe. Nesses casos, você precisa agrupar em bins ou usar densidade kernel, o que adiciona complexidade mas recupera a informação.Implementação prática
Em Python, o cálculo das três medidas é direto com a biblioteca NumPy ou Pandas. Um exemplo rápido com dados do mundo real:import numpy as np import pandas as pd dados = pd.read_csv('dataset_real.csv') media = dados['variavel'].mean() mediana = dados['variavel'].median() moda = dados['variavel'].mode()[0] print(media, mediana, moda)
👉 Clique no botão abaixo para saber mais sobre o assunto!