Classificando dispersões na prática
Muita gente estuda classificação de gráficos de dispersão pela teoria e depois trava na hora de analisar dados reais. A questão é que os gráficos se dividem em categorias que às vezes se sobrepõem, e o mais importante não é decorar os tipos, mas saber qual olhar aplicar conforme o cenário. Quando falo sobre como as dispersões se classificam, preciso deixar claro desde o início que a classificação mais usada no dia a dia é aquela baseada na correlação — direção, intensidade e forma —, mas existem outras camadas que fazem diferença real na interpretação.
Como as dispersões se classificam segundo a relação entre variáveis
A primeira camada é a mais óbvia. Você olha para o padrão dos pontos e define se a relação é positiva, negativa ou nula. Positiva quer dizer que conforme uma variável sobe, a outra também tende a subir. Negativa é o oposto: uma sobe e a outra desce. Nula significa que não há padrão perceptível, e nesse caso o gráfico de dispersão quase não agrega valor à análise. A intensidade da correlação é o que realmente separa um gráfico útil de um que só ocupa espaço na apresentação. Correlação forte mostra os pontos agrupados de forma bem definida ao redor de uma linha ou curva. Correlação moderada permite ver o padrão, mas com mais espalhamento. Correlação fraca deixa os pontos quase distribuídos sem estrutura clara. O coeficiente de Pearson entra aqui como referência numérica, mas ele só mede relação linear, então já adianto que esse é um ponto onde muita gente erra.
Outras formas de classificação que todo analista deveria conhecer
Além da correlação, os gráficos de dispersão se classificam pela forma da relação. Linear é quando os pontos se alinham ao redor de uma reta. Não linear — também chamada de curvilínea — aparece quando o padrão segue uma curva, como um parábola ou uma exponencial. Esse último caso é particularmente traiçoeiro porque o Pearson pode mostrar correlação próxima de zero mesmo existindo uma relação forte e previsível entre as variáveis. Temos também a classificação por homogeneidade da dispersão. Quando a variância dos pontos se mantém mais ou menos constante ao longo de todo o intervalo da variável independente, chamamos de homocedasticidade. Quando a dispersão aumenta ou diminui conforme avançamos no eixo X, temos heterocedasticidade. Isso é crucial se você pretende rodar regressões depois, porque a heterocedasticidade viola uma das premissas fundamentais do modelo e pode gerar intervalos de confiança completamente equivocados.
Outro eixo de classificação que vejo pouco mencionado é a presença de clusters. Às vezes os pontos se agrupam em densidades distintas dentro do mesmo gráfico, o que indica que pode haver subpopulações ou segmentos não considerados na coleta dos dados. Ignorar isso leva a conclusões generalistas que não representam nenhum dos grupos corretamente.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O problema que ninguém conta sobre gráficos de dispersão
Eu trabalhei durante anos analisando dados de performance operacional eDepois de passar horas construindo dashboards, você acaba encontrando um padrão que parece perfeito no papel, mas que no gráfico se desmonta completamente. Vou dar um exemplo bem específico que me passou uma lição barulhenta. Em 2019, estava analisando a relação entre tempo de resposta de servidores e carga de processamento. O gráfico de dispersão mostrou uma correlação positiva aparentemente forte. Rutei a regressão, o R² era 0,82. Parecia um modelo sólido. Mas quando apliquei um teste de Breusch-Pagan para verificar homocedasticidade, descobri que a variância dos resíduos crescia exponencialmente conforme a carga aumentava. O modelo parecia bom porque os pontos estavam agrupados na região de baixa carga, onde a dispersão era menor, e isso mascarava o problema. A consequência prática foi que as previsões para cenários de alta carga estavam sistematicamente subestimadas, e isso gerou decisões de dimensionamento de infraestrutura incorretas.
A solução que encontrei foi transformar a variável dependente usando logaritmo natural, o que estabilizou a variância e tornou o modelo mais confiável para toda a faixa de operação. Não foi uma correção elegante, foi uma correção que salvou o projeto de ter que refazer toda a análise meses depois.
Pegadinhas que aparecem com frequência
Eclosão de Simpson é uma delas. Já vi gráficos de dispersão que mostravam correlação negativa no agregado, mas quando segmentei por região geográfica, cada grupo individual apresentava correlação positiva. O fenômeno ocorre porque grupos de tamanhos e distribuições diferentes se comportam de maneiras distintas, e o aggregate esconde essa realidade. Sempre que houver pelo menos uma variável categórica relevante nos seus dados, faça o gráfico segmentado antes de tirar conclusões globais. O outro problema clássico é confundir correlação com causalidade. Um gráfico de dispersão nunca prova que uma variável causa a outra. Ele apenas mostra associação. Para afirmar causalidade, você precisa de um desenho experimental ou de métodos causais como regressão descontínua, diferenças-em-diferenças ou variáveis instrumentais. Gráfico de dispersão sozinho não faz nenhuma dessas coisas.
Também é importante notar que gráficos de dispersão não lidam bem com grandes volumes de dados. Com mais de dez mil observações, os pontos se sobrepõem e o gráfico vira uma mancha indistinguível. Nesse cenário, o ideal é usar histogramas bidimensionais, hexbins ou amostragem estratégica para manter a legibilidade sem perder informação relevante.
Quando o gráfico de dispersão simplesmente não serve
Se suas variáveis forem categóricasnominais, o gráfico de dispersão é inadequado. Para variáveis ordinais, ele pode funcionar, mas a interpretação fica comprometida porque a distância entre categorias não é uniforme. Para dados temporais densos, séries temporais ou análises que envolvem mais de três variáveis simultaneamente, existem ferramentas mais apropriadas como gráficos de linha, heatmaps ou análises multivariadas como PCA. Não force um gráfico de dispersão onde outra representação entrega mais clareza com menos esforço.