Como calcular na prática
A fórmula que você vê em todo livro didático é P(A B) = P(A) + P(B) P(A B). Parece simples até o dia em que você tenta aplicar e percebe que não sabe qual é a interseção. Na minha experiência trabalhando com análise de dados, esse é o primeiro ponto onde as coisas travam. A maioria dos problemas que chegam na minha mesa já vem com os eventos definidos de forma ambígua. O cliente diz "queremos saber a probabilidade de o cliente comprar ou cancelar o serviço" e aí você fica encarando a planilha sem saber se compra e cancelamento são mutuamente exclusivos ou não.
Entendendo probabilidade da união de dois eventos
O conceito em si é direto: a união de dois eventos representa a probabilidade de pelo menos um deles acontecer. Não importa qual. Basta um. O erro mais comum que eu vejo acontece quando alguém calcula P(A) + P(B) sem verificar se há sobreposição. Se os eventos compartilham ocorrências, você está somando duas vezes aquilo que está no meio. Por isso o subtração da interseção existe. Não é um truque matemático, é correção de contagem duplamente feita. Eu tive um caso recente em que precisei calcular essa probabilidade para um modelo de churn de assinantes SaaS. Os dois eventos eram: cliente fez upgrade de plano (A) e cliente cancelou na mesma janela (B). Inicialmente, assumi que eram mutuamente exclusivos porque me pareceram contraintuitivos acontecerem juntos. Estava errado. Houve uma parcela significativa de clientes que fizeram upgrade e depois cancelaram dentro do mesmo mês. O erro me custou cerca de 18% de sobreestimação na probabilidade da união. A correção foi cruzar os dados brutos do banco para extrair diretamente a interseção, em vez de tentar estimá-la por suposição.
Quando os eventos são mutuamente exclusivos
Se A e B não podem ocorrer ao mesmo tempo, a fórmula simplifica para P(A B) = P(A) + P(B). Isso acontece frequentemente em problemas teóricos, mas raramente no mundo real. Eu vejo analistas iniciantes aplicarem essa simplificação em cenários onde a exclusividade mútua nunca foi verificada. O resultado parece limpo e ordenado, o que leva a uma falsa sensação de segurança. Para confirmar se dois eventos são mutuamente exclusivos, você precisa verificar se P(A B) = 0. Na prática, isso significa que nenhuma ocorrência simultânea foi registrada nos dados. Se existe pelo menos um registro de overlap, mesmo que pequeno, a simplificação introduz erro sistemático. Em conjuntos de dados com milhares de observações, um overlap de 2% pode parecer irrelevante. Em probabilidades baseadas em amostras pequenas, o mesmo 2% distorce completamente o resultado.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Cálculo passo a passo com dados reais
Vamos pegar um exemplo concreto. Digamos que você está analisando a taxa de conversão em uma landing page. Evento A: o visitante clica no botão de compra. Evento B: o visitante preenche o formulário de contato. Dos 1.000 visitantes, 120 clicaram no botão, 80 preencheram o formulário e 30 fizeram ambas as coisas. O cálculo fica assim: P(A) = 120/1.000 = 0,12. P(B) = 80/1.000 = 0,08. P(A B) = 30/1.000 = 0,03. Aplicando a fórmula completa: 0,12 + 0,08 0,03 = 0,17. A probabilidade de um visitante clicar no botão ou preencher o formulário é 17%. Se você tivesse somado simplesmente 12% + 8%, o resultado errado seria 20%. Uma diferença de 3 pontos percentuais que em escala de campanha pode significar decisões orçamentárias equivocadas.
Erros que eu vejo todo dia
O primeiro erro frequente é tratar eventos dependentes como independentes. Quando A e B são dependentes, P(A B) não é igual a P(A) × P(B). Esse produto só funciona para eventos independentes. Confundir dependência com independência é um erro clássico que gera subestimação ou superestimação da interseção, dependendo da correlação real entre os eventos. No exemplo do churn acima, upgrade e cancelamento eram claramente dependentes — quem faz upgrade tem um padrão de uso diferente que influencia a chance de cancelamento. O segundo erro é trabalhar com probabilidades condicionais sem registrar isso. Às vezes você só tem P(A|B) ou P(B|A). Aí precisa reorganizar: P(A B) = P(A|B) × P(B). Se você tem apenas a probabilidade condicional e não a marginal, não consegue fechar a conta. Já vi gente tentar adivinhar a interseção nesse cenário. Não funciona.
Limitações que ninguém menciona
A fórmula da união assume que você conhece as probabilidades individuais e a interseção. Em muitos casos reais, você não conhece nenhuma das três com precisão. Trabalha-se com estimativas baseadas em amostras, e a incerteza se propaga. Um erro de 5% em P(A) e outro de 5% em P(B) podem resultar em um erro de até 10% na união, dependendo da direção dos viéses. Para aplicações que exigem alta precisão, o ideal é construir intervalos de confiança para cada componente antes de aplicar a fórmula. Outro ponto que causa problemas é a definição dos eventos. Se A for "o cliente comprou algo" e B for "o cliente comprou mais de uma vez", B está contido em A. Nesse caso, a união é simplesmente A. A interseção é B inteira. Eu perdi tempo num relatório interno identificando que dois dos quatro eventos que estávamos modelando tinham relação de inclusão. Simplificou tudo, mas só após duas rodadas de refinamento.
Uma alternativa quando os dados são escassos
Se você não tem dados suficientes para estimar a interseção diretamente, uma saída prática é usar simulação de Monte Carlo. Gera-se um grande número de cenários hipotéticos baseados nas distribuições marginais observadas e se calcula a frequência relativa da união. Esse método é mais pesado computacionalmente, mas contorna a falta de dados sobre dependência. Funciona razoavelmente bem quando as marginais são confiáveis mesmo que a estrutura de dependência seja desconhecida. Em situações onde tanto as marginais quanto a dependência são incertas, o melhor caminho é declarar a incerteza explicitamente em vez de forçar um número. O que funciona na prática é começar sempre pela verificação da interseção. Antes de qualquer cálculo, pergunte: esses eventos podem acontecer juntos? Tem dados que mostram isso? Se a resposta for não, use a fórmula completa. Se a resposta for sim, extraia a interseção dos dados antes de substituir qualquer coisa na equação. O resto é aritmética.