O que é população em pesquisa — e onde a maioria erra
População é o conjunto completo de elementos que compartilham características definidas pelo pesquisador e aos quais se destinam as conclusões do estudo. Simples assim. A confusão começa na hora de definir os limites. O que conta como elemento? Uma pessoa, uma empresa, uma ocorrência, um resultado de teste? A resposta depende da pergunta de pesquisa, não do método estatístico. Já vi gente tratar população e amostra como sinônimos em proposals de TCC. O resultado é metodologia que não sobrevive à banca. População não é "todo mundo". É todo mundo que preenche os critérios de inclusão — e só. Se você está estudando satisfação de clientes de uma operadora de telecomunicações, a população são os clientes que tiveram pelo menos uma fatura quitada nos últimos doze meses, não todos os brasileiros que sabem o nome da marca.
Entendendo o conceito de populacao na pratica
A definição operacional da população determina tudo depois dela: tamanho da amostra, tipo de amostragem, erro padrão, poder do teste. Se você definiu mal a população, nenhuma correção amostral conserta o problema. Já trabalhei em um projeto de pesquisa eleitoral onde a população foi definida como "eleitores de uma cidade com mais de 500 mil habitantes". Na prática, o distrito eleitoral tinha 312 mil habitantes cadastrados, e 47 mil deles estavam com o título suspensos. Saímos trabalhando com uma população 40% maior que o reais, e o erro amostral calculado ficou completamente distorcido. O ajuste foi simples: acessar o cadastro eleitoral atualizado no TSE, cruzar com os dados do Censo do IBGE, e refazer toda a tabela de amostragem. Gastei dois dias refazendo os cálculos. O primeiro boletim de amostra, baseado na população incorreta, já havia sido distribuído para as equipes de campo. Precisamos recolher e redistribuir. Aprendi que nunca se deve confiar em estimativas de população de fontes secundárias sem verificação direta dos dados primários.
Outro ponto que passa despercebido: população finita versus infinita. A estatística introdutória ensina que quando a população é grande o suficiente, trata-se como infinita e ignora o fator de correção. Mas o "suficiente" não é um número mágico. A regra prática do fator de correção populacional (FPC) se aplica quando a amostra excede 5% da população. Em populações de pequeno porte — uma cooperativa de 200 membros, uma escola com 450 alunos — ignorar o FPC pode inflacionar o erro padrão em 15 a 30%. Isso não é erro técnico, é erro de reporte.
Definindo a população passo a passo
A definição começa com três perguntas que devem ser respondidas por escrito antes de qualquer outra coisa: Quem ou o quê está sendo estudado. Elementos podem ser indivíduos, organizações, eventos, produtos, transações. A natureza do elemento define o universo de observação.
Quando se aplica a delimitação temporal. População de pacientes atendidos em um hospital no período de janeiro a dezembro de 2023 é diferente de população de pacientes atendidos em qualquer momento. A janela temporal muda o tamanho e as características. Onde se aplica a delimitação geográfica ou setorial. Pesquisa sobre produtividade em fábricas têxteis no estado de São Paulo não é a mesma que pesquisa sobre fábricas têxteis em todo o Brasil. O escopo geográfico é tão decisivo quanto qualquer critério demográfico.
Cada critério que você adiciona reduz a população. Cada critério que você esquece de adicionar a inflaciona. O ideal é listar todos os critérios de inclusão e exclusão explicitamente. Quando entrevistei um pesquisador que estava estudando "ansiedade em adolescentes", ele havia esquecido de delimitar a faixa etária. "Adolescente" varia de 10 a 19 anos segundo a OMS, mas no Brasil o Estatuto da Criança e do Adolescente abrange até 18 anos. Ele tinha consentimentos de pais para menores de 16 e assentimento dos jovens para maiores de 16. Sem delimitação explícita, não dá nem para saber se a amostra foi coletada dentro do marco legal correto.
População-alvo, população acessivel e amostra
Essa hierarquia é onde a maioria dos projetos perde qualidade. A população-alvo é o grupo ao qual você gostaria de generalizar. A população acessível é o subconjunto da população-alvo que você efetivamente consegue alcançar com os recursos disponíveis. A amostra é o que você efetivamente observa. Na prática, existe um colapso constante entre esses três níveis. Um pesquisador de saúde pública quer estudar "todas as gestantes do SUS em Minas Gerais" como população-alvo. O orçamento permite apenas quatro municípios. A população acessível são as gestantes desses quatro municípios. A amostra são as 680 gestantes entrevistadas. Se ele relatar que a generalização é para "Minas Gerais", o relatório está distorcido. A generalização válida é restrita aos municípios estudados, a menos que haja justificativa amostral robusta para expansão — o que é raro.
O viés de acessibilidade é um dos problemas mais comuns em pesquisa aplicada. Bancos que pesquisam satisfação com seus clientes usando apenas app e canais digitais excluem deliberadamente a parcela mais idosa da população. O resultado é uma métrica de satisfação sistematicamente inflacionada. Já vi índices de NPS interno que chegavam a 72 em bancos que tinham reputação pública de atendimento ruim. A discrepância era inteiramente dovuta ao viés de canal: quem liga para a Ouvidoria não estava no frame da população pesquisada.
Tamanho da população e cálculo amostral
O tamanho da população entra no cálculo da amostra de forma diferente do que a maioria imagina. Para populações muito grandes — digamos, acima de 100 mil elementos — o tamanho populacional tem impacto quase nulo no tamanho da amostra necessária. Uma população de 1 milhão e uma de 10 milhões geram amostras praticamente idênticas para o mesmo nível de confiança e margem de erro. Para populações pequenas, o efeito é direto. Populações abaixo de mil elementos exigem o uso do FPC, que reduz proporcionalmente o tamanho amostral necessário. A fórmula básica com FPC para populações finitas é:
👉 Clique no botão abaixo para saber mais sobre o assunto!
n = (Z² × p × q × N) / (e² × (N-1) + Z² × p × q) Onde Z é o escore z para o nível de confiança desejado, p é a proporção estimada, q é 1-p, N é o tamanho da população e e é a margem de erro. Sem FPC, a fórmula simplifica para n = Z² × p × q / e², que é a versão que todo mundo decora e esquece de verificar se é aplicável.
Um exemplo concreto: para uma população de 800 unidades, com confiança de 95% (Z = 1,96), proporção estimada de 50% e margem de erro de 5%, o tamanho amostral com FPC é de aproximadamente 267 respostas. Sem o FPC, a conta daria 385. A diferença é de 118 elementos — quase 44% a mais do que seria necessário. Em pesquisa com custo por entrevista de R$ 80, isso representa R$ 9.440 a mais em gastos sem ganho real de precisão.
Amostragem probabilistica e nao probabilistica
Amostragem probabilística exige que todos os elementos da população tenham probabilidade conhecida e não nula de serem selecionados. Isso permite calcular erro amostral e generalizar resultados com base probabilística. Os tipos mais comuns são: Aleatória simples: sortear elementos diretamente de uma lista completa da população. Funciona bem quando se tem lista eletrônica atualizada. O problema prático é que raramente se tem essa lista em condições ideais.
Estratificada: divide a população em estratos homogêneos e sorteia dentro de cada um. Útil quando subgrupos têm comportamentos diferentes e é preciso garantir representação. Em pesquisa de renda, estratificar por região gera amostras mais precisas sem aumentar o tamanho total. Por conglomerados: sorteia-se grupos naturais (bairros, escolas, setores) e pesquizam-se todos os elementos dentro dos grupos selecionados. Reduz custo de campo significativamente, especialmente em pesquisas domiciliares. O INEP faz isso com escolas como conglomerados em vez de tentar listar todos os estudantes do Brasil.
Sistemática: seleciona-se um ponto de partida aleatório e depois um elemento a cada k posições em uma lista ordenada. Prática e rápida, mas vulnerável a padrões ocultos na lista. Se a lista tiver periodicidade alinhada com o intervalo k, a amostra vicia. Amostragens não probabilísticas — por conveniência, quota, judgement e bola de neve — não permitem cálculo de erro amostral. São úteis em pesquisa qualitativa e estudos exploratórios. O erro ocorre quando pesquisadores usam amostras não probabilísticas e reportam intervalos de confiança como se fossem probabilísticos. Isso acontece com frequência em pesquisas de mercado que contratam empresas de polling e recebem resultados com margem de erro declarada usando metodologia oposta.
Erros frequentes e como evitá-los
O erro mais comum é tratar a população como homogênea quando ela não é. Populações com variabilidade interna alta exigem amostras maiores ou estratificação. Uma população de usuários de um aplicativo que inclui tanto adolescentes quanto idosos tem distribuição bimodal em quase qualquer variável de uso. Amostra simples nessa população tende a mascarar diferenças importantes entre os grupos. O segundo erro é confundir representatividade amostral com representatividade populacional. Uma amostra pode ser estatisticamente representativa — bem construída, com erro calculável — e ainda assim não representar a população-alvo se o frame de amostragem estiver incompleto. Já enfrentei isso em pesquisa sobre acesso a serviços públicos: o frame usava cadastro municipal, mas uma parcela significativa da população não estava cadastrada porque morava em áreas de irregularidade fundiária. A amostra era metodologicamente sólida, mas capturava aproximadamente 60% da população real.
O terceiro erro, e talvez o mais perigoso, é generalizar além dos limites da população definida. Um estudo sobre satisfação de residentes de condomínios fechados em cidades médias não tem legitimidade para generalizar para a população urbana brasileira. As conclusões valem estritamente para o frame definido. Qualquer extrapolation é especulação, não resultado de pesquisa.
Limitações do conceito
O conceito de população funciona bem quando o universo de estudo é fechado e delimitável. Não funciona bem em contextos de população difusa — comunidades online, populações flutuantes, grupos definidos por comportamento transitório. Nesses casos, o frame de amostragem jamais será completo, e o erro de amostragem não cobre toda a margem de incerteza. O que resta é transparência sobre as limitações do frame e uso de métodos qualitativos ou mistos que não dependam de generalização estatística. Em pesquisas longitudinais, a população muda ao longo do tempo. Novos elementos entram, outros saem. Tratar a população como estática em estudos de vários anos distorce as conclusões. A solução é definir janelas de coorte e tratá-las como populações distintas dentro do mesmo projeto.
O conceito de população é a base de toda inferência estatística. Definir mal essa base compromete tudo o que vem depois, independentemente de quão sofisticado seja o modelo final.