Função Densidade De Probabilidade - Função Densidade de Probabilidade para t de Student. Fonte: Autores ...
Função Densidade de Probabilidade para t de Student. Fonte: Autores ...

O que você realmente precisa saber sobre pdf antes de abrir qualquer livro de estatística

A primeira coisa que todo mundo confunde é que a função densidade de probabilidade te dá uma probabilidade. Ela não dá. Ela te dá uma densidade. O valor da função em um ponto x isolado não significa nada em termos de chance de acontecer. O que importa é a área sob a curva entre dois pontos. Sem essa distinção clara, você vai cometer erros de interpretação desde o início e ainda vai passar vergonha em reunições com pessoas que realmente trabalham com dados diariamente.

Função densidade de probabilidade na prática

Vou explicar pela ordem inversa porque a definição formal é onde a maioria das pessoas desiste. Na prática, você começa com um histograma. Pega seus dados, divide em bins, conta quantos caem em cada faixa. Quando você normaliza esse histograma de forma que a área total seja igual a 1 e depois deixa o número de observações tender ao infinito enquanto a largura dos bins tende a zero, o que surge é exatamente a função densidade de probabilidade. É uma coisa viva, não uma fórmula mágica que cai do céu. A definição formal diz que f(x) é uma função tal que f(x) >= 0 para todo x e a integral de menos infinito a mais infinito de f(x)dx é igual a 1. A probabilidade de X estar entre a e b é a integral de f(x) entre a e b. Pronto. Isso é tudo. A notação integral pode assustar quem não viu cálculo há anos, mas o conceito é trivial: área sob a curva.

O problema é que os livros param aí e partem direto para distribuição normal, exponencial, Poisson, sem explicar o que acontece quando a realidade não se encaixa em nenhuma dessas formas conhecidas. É aí que a coisa fica interessante. No meu trabalho, lidei recentemente com dados de tempo de resposta de um serviço de API que tinha uma cauda pesada bimodal. A primeira moda correspondia às requisições dentro do padrão, a segunda às requisições que passavam por um processo de cache que adicionava latência variável. Tentei ajustar uma mistura de normais primeiro. Funcionou razoavelmente bem, mas a estimativa de parâmetros via máxima verossimilhança demorou cerca de 45 minutos e ainda assim oscilava dependendo do chute inicial. A solução final foi usar estimação por kernel com um bandwidth selecionado via validação cruzada. O resultado foi um pdf não paramétrico que capturava ambas as modas sem precisar assumir nenhuma forma funcional prévia. Gastei aproximadamente 20 minutos no total, incluindo a depuração do código Python.

Aqui vai algo que quase ninguém ensina: a densidade em um ponto específico pode ser maior que 1. Não há erro nenhum nisso. A função densidade de probabilidade não é limitada superiormente a 1. O que é limitado é a probabilidade, que sempre fica entre 0 e 1. Se você vê f(x) = 3.7 em algum lugar, não se preocupe. Significa simplesmente que num intervalo muito pequeno ao redor daquele ponto, a probabilidade concentrada é alta. Para distribuição normal com desvio padrão muito pequeno, por exemplo, o pico da curva facilmente ultrapassa 10 ou 20. Isso não viola nada. Outro detalhe que causa confusão constante é a diferença entre função de massa de probabilidade e função de densidade de probabilidade. A primeira é para variáveis discretas. A segunda é para variáveis contínuas. Variável discreta pega probabilidade em pontos exatos. Variável contínua só faz sentido com intervalos. A probabilidade de uma variável contínua ser exatamente igual a um valor específico é sempre zero. Isso não quer dizer que esse valor seja impossível. Quer dizer que calcular a probabilidade de um ponto exato num contínuo é uma operação matematicamente vazia. Você sempre precisa de um intervalo, por menor que seja.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Quando você trabalha com dados reais, esbarra em problemas que os exercícios dos livros não mostram. Um deles é a escolha do bandwidth na estimação não paramétrica. Bandwidth muito pequeno gera um pdf cheio de picos e vales que são ruído, não sinal. Bandwidth muito grande suaviza demais e apaga características importantes dos dados. Não existe fórmula perfeita. A regra de dedo de Silverman e a de Scott são bons pontos de partida, mas o ideal é testar várias opções e comparar visualmente com o histograma bruto dos dados. Outra armadilha comum é a fronteira dos dados. Se seus dados estão restritos a valores positivos e têm concentração perto de zero, um estimador por kernel padrão vai vazar densidade para valores negativos, que não fazem sentido no seu contexto. Nesse caso, use transformações ou estimadores refletidos. Eu resolvi isso transformando os dados com log, aplicando o kernel no espaço transformado e depois reconvertendo a densidade para a escala original usando o jacobiano da transformação. Demorou uma tarde inteira para eu entender por que a densidade estimada não integrava a 1, e a causa era justamente o jacobiano que eu estava ignorando. Na hora de implementar, a biblioteca mais usada no ecossistema Python é o SciPy, especificamente a função gaussian_kde. No R, o density() resolve. Mas ambas as funções têm limitações sérias que raramente são documentadas. A gaussian_kde do SciPy usa uma aproximação de matriz de covariância que assume que os dados são multidimensionais e suaviza igualmente em todas as direções. Se seus dados têm correlação forte entre variáveis, o resultado pode ser distorcido. O density() do R faz uma escolha automática de bandwidth que funciona bem na maioria dos casos, mas que falha badly quando a distribuição é multimodal com picos de alturas muito diferentes. O pico menor pode simplesmente desaparecer.

Se você está começando agora, o caminho mais direto é entender primeiro a distribuição normal padrão e como qualquer outra distribuição normal deriva dela pela transformação linear. Depois, estude a exponencial e a uniforme. Essas três cobrem a maioria dos cenários práticos. Só depois parta para distribuições mais exóticas. Quando for analisar dados de verdade, comece sempre com um histograma e umqq plot antes de tentar ajustar qualquer modelo paramétrico. A maioria dos problemas de modelagem começa com alguém pulando essa etapa e forçando uma distribuição que não descreve os dados adequadamente. Uma coisa que pouca gente lembra é que a função densidade de probabilidade não é única para uma dada distribuição acumulada. Em pontos de descontinuidade da função cumulative, a densidade pode ser definida de formas arbitrárias sem alterar as probabilidades calculadas. Na prática isso raramente importa porque a maioria das distribuições que usamos são contínuas, mas em simulações com discretização numérica, diferenças na definição da densidade nos pontos de quebra podem gerar variações pequenas mas mensuráveis nos resultados.

Para dados discretos, muitos técnicos usam o termo "densidade" de forma solta quando na verdade estão lidando com funções de massa. Isso não é um erro fatal, mas causa confusão desnecessária. Se suas variáveis assumem valores em um conjunto contável, trabalhe com PMF. Se assumem valores em um contínuo, trabalhe com PDF. Manter essa separação evita que você aplique integrais onde deveria estar somando, ou vice-versa. O cálculo de momentos a partir do pdf também merece atenção. O segundo momento, que dá a variância, é sensível a outliers de forma muito mais agressiva do que a média. Em distribuições com caudas pesadas como a de Pareto, o segundo momento pode não existir de fato, mesmo que a média exista. Antes de calcular variância ou desvio padrão a partir de um pdf estimado, verifique se os momentos de ordem relevante realmente existem. Caso contrário, o número que você obterá será instável e dependerá fortemente das observações mais extremas da amostra.

Se o seu objetivo é apenas visualizar a forma de uma distribuição e não precisa de inferência estatística rigorosa, a função densidade de probabilidade paramétrica pode ser overkill. Um simples histograma normalizado ou um gráfico de violino entrega informação suficiente na maior parte dos casos e evita toda a complexidade de escolha de modelo e estimação de parâmetros. Reserve os métodos de estimação de densidade para quando você realmente precisa deles: quando está construindo modelos preditivos, fazendo análise de sobrevivência, ou trabalhando com simulações Monte Carlo onde a forma exata da distribuição importa para a precisão dos resultados.