Como funciona a avaliação de impacto em políticas de saúde pública na prática
A maioria dos gestores públicos aprende sobre avaliação de impacto de políticas de saúde pública de forma teórica, em treinamentos que raramente contemplam os problemas reais que aparecem quando você precisa executar. Nos últimos anos trabalhei com avaliações em municípios e estados diferentes e, no geral, o processo segue uma lógica clara, mas cada etapa tem suas armadilhas específicas. O ponto de partida costuma ser a definição do desenho avaliativo. Para políticas universais, onde toda a população-alvo recebe a intervenção, randomized controlled trials não funcionam. Ninguém vai randomizar uma campanha de vacinação por bairro em pleno andamento. O mais viável nesses casos é usar difference-in-differences com dados municipais ou estaduais, pareando unidades expostas e não expostas por propensity score ou matching geográfico. A qualidade da estimativa depende quase inteiramente da validade do paralelismo das tendências pré-intervenção.
Políticas de saúde pública e os problemas que aparecem no campo
O problema mais comum que vejo é a contaminação entre grupos de tratamento e controle. Se uma política de saúde pública muda a classificação de um município para o grupo de controle porque ele adotou uma versão adaptada da mesma intervenção seis meses depois, o efeito estimado vai diluir. A correção prática é usar data de exposição única e bem definida, com truncamento da amostra a partir desse momento, e testar efeitos dinâmicos nos períodos anteriores para garantir que não havia diferença de tendência prévia. Outro problema recorrente é a heterogeneidade dos dados entre fontes. Sistemas de informação em saúde diferentes usam códigos e periodicidades distintas. O SIAB não se alinha automaticamente com o SIPAR ou com o SIM, e cross-tabular mortalidade por causa externa com dados de cobertura de APS exige limpeza manual. A solução que funciona na prática é padronizar as variáveis por código Tabela 10 da CID antes de qualquer análise, usando como referência o manual do DATASUS com as definições de 2023.
Etapas práticas para conduzir uma avaliação
A primeira coisa a fazer é mapear a política em si. Qual o escopo territorial, quais são os critérios de elegibilidade, qual o orçamento autorizado, e qual o período de vigência. Sem isso, não dá para construir nem mesmo o grupo de comparação direito. Depois vem a escolha da unidade analítica. Avaliar por município isolado muitas vezes gera viés de pequenos números, especialmente em regiões com menos de 50 mil habitantes. Nestes casos, o recomendado é agregar por microrregião ou manter a unidade municipal mas usar modelagem hierárquica com shrinkage nos efeitos locais.
A coleta de dados depende do indicador. Para resultados em saúde, o DATASUS oferece acesso direto via API e também por download manual nas tabelas do Sistema de Informação sobre Mortalidade, Hospitalizações Sensíveis a Atenção Primária e Informações de Nascidos Vivos. Para dados de processo, como cobertura vacinal ou realização de consultas de pré-natal, o e-SUS APS e o PNC-I são as fontes principais. Dados econômicos e sociais geralmente vêm do IBGE, Censo 2022 ou PNAD Contínua, dependendo da abrangência temporária desejada. O modelo econométrico propriamente dito começa com o teste de paralelismo. Plots de eventos estudos com leads e lags até cinco períodos antes da intervenção são padrão. Se houverAlready divergência nos coeficientes pré-tratamento, o modelo em diferenças não é confiável e é preciso considerar synthetic control ou regressive discontinuity se houver um cutoff claro na política.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Pegadinhas que poucos mencionam
Uma delas é o efeito de substituição. Quando uma política de saúde pública foca em uma condição, como hipertensão, os custos e a atenção podem deslocar recursos de outras áreas. O indicador principal pode melhorar, mas o orçamento total de saúde não necessariamente. Sempre convém incluir uma análise de custo-efetividade junto com o efeito sanitário para evitar conclusões enganosas. A segunda pegadinha é a agregação temporal. Políticas costumam ter implementações graduais. Um município começa no primeiro trimestre, outro no terceiro. Tratar tudo como treatment contemporâneo gera estimação viesada. O correto é tratar a data de implementação como time-varying, registrando o mês exato em que cada unidade entrou no treatment.
Quando não usar esse tipo de análise
Se a política foi implementada em todo o território nacional simultaneamente, difference-in-differences não identifica nenhum efeito. Não existe grupo de controle. Nesse cenário, a alternativa mais honesta é analisar variações subnacionais na intensidade da implementação, usando o nível de adesão ou recurso aplicado como variável contínua de tratamento, com controls fixos de unidade e tempo. O viés residual permanece, mas pelo menos você evita afirmar causalidade onde não há. Outro caso em que a abordagem falha é quando a política altera variáveis de confusão após a intervenção. Mudanças legislativas paralelas, como ajustes no piso salarial da saúde ou revisões no repasse do Fundo Nacional, geram variáveis omitidas que corroem a identificação. A mitigação possível é incluir variáveis de controle temporal específicas para esses choques, mas o resultado sempre carrega incerteza adicional que deve ser reportada transparentemente.
Recursos e onde encontrar os dados
Para execução, os pacotes R fixest e eventstudyinteract são os mais práticos para modelos com fixed effects bidirecionais e estimativas dinâmicas. O pacote Craft serve bem para synthetic control em contextos de políticas de saúde pública quando o número de unidades tratadas é pequeno. Em Stata, did_imput e aggte cobrem as mesmas necessidades. Os dados ficam disponíveis gratuitamente. O repositório do DATASUS permite baixar arquivos brutos diretamente, e o portal de transparência do Ministério da Saúde disponibiliza séries históricas consolidadas. Para dados municipais mais recentes que ainda não estão no DATASUS, oipea do IBGE é a fonte alternativa. A integração entre as bases exige trabalho manual, mas o esforço vale a pena porque a alternativa é ficar preso a indicadores indiretos ou defasados.
O que eu recomendo como passo final antes de entregar qualquer resultado é rodar placebo tests. Aplicar a intervenção em datas fictícias antes do ano real e verificar se os coeficientes permanecem próximos de zero. Se permanecerem, a especificação está consistente. Se aparecerem efeitos espúrios em períodos onde nada mudou, algum viés estrutural está presente e precisa ser investigado antes de interpretar qualquer resultado como válido.