Uma técnica que todo mundo usa errado na hora de investigar qualquer coisa na internet
Eu comecei a usar o sistema what where who when de verdade depois de ter que rastrear um domínio suspeito que estava hospedado em algum lugar da Europa Eastern e eu precisava encontrar o responsável por trás dele. Não era algo que você resolve com uma busca no Google. Era mais sobre estrutura do que sobre ferramenta. A pergunta que as pessoas esquecem de fazer é qual a pergunta correta para cada fatia do problema.
what where who when: o básico que funciona se você parar de enrolação
O que eu faço sempre, antes de abrir qualquer ferramenta, é escrever num pedaço de papel os quatro campos. Parece bobo, mas a maioria das pessoas pula direto pra ação e acaba coletando informação demais do lugar errado. O that é o evento ou o objeto. O where é o local físico ou digital. O who é o agente. O when é o momento. Só depois eu monto a estratégia de busca. Um exemplo prático. Eu precisei identificar quem era o dono de um servidor de IRC que estava distribuindo malwares há uns anos. Eu comecei pelo when — encontrei logs públicos de 2019 que mostravam a atividade do servidor. Aí fui pro what — o tipo de malware distribuído era um RAT bem específico. Com isso, mapeei o where: os IPs de saída e os servidores DNS reversos. E finalmente o who: o registrant do domínio principal que aparecia nos certificados TLS capturados nos logs. Levei cerca de 4 horas. Se eu tivesse começado pelo who diretamente, teria gasto dois dias sem nada.
Como aplicar na prática cada variável
O que pede buscas por tipo de conteúdo, protocolos, padrões. Usar palavras-chave técnicas combinadas com operadores. site: para restringir domínios, filetype: para arquivos, intitle: para títulos de páginas. Isso separa o ruído rápido. Eu costumo montar queries como "RAT filetype:pdf intitle:relatório site:.br" quando estou caçando algo relacionado ao Brasil, por exemplo. Onde exige geolocalização e análise de infraestrutura. Aqui é onde a maioria erra. Eles buscam o endereço físico quando deveriam primeiro mapear a infraestrutura digital. DNS, ASN, Whois, registros de Certificate Transparency. Eu tenho uma lista de ferramentas que uso: o Whois API, o Shodan para serviços expostos, o Censys como alternativa mais completa. O truque é cruzar os dados. Um IP isolado não te diz nada. Um IP com histórico de resoluções DNS, registros WHOIS anteriores e serviços expostos no Shodan forma um padrão que é muito mais difícil de ignorar.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Quem é a parte mais difícil e a mais importante. Busca por nomes, emails, CPFs, CNPJs, redes sociais. No Brasil, uma coisa que poucas pessoas sabem é que você pode cruzar registros da Receita Federal com buscas em redes sociais usando o nome da empresa ou do sócio. APIs de consulta de CNPJ são gratuitas em sites como o dadosjusbr e o próprio site da Receita. Combina isso com uma busca no Google do tipo "nome completo empresa" e você tem muita coisa em poucos minutos. O problema é que muita gente usa nomes sociais ou empresas de terceiros, o que complica. Quando é a variável que dá contexto e reduz falsos positivos. Uma data de registro de domínio, um timestamp num log, um post em rede social. Quando eu vejo que alguém está pulando essa etapa, eu sei que vai voltar atrás. Um domínio registrado hoje pode ser irrelevante. O mesmo domínio registrado em 2015 com histórico de uso em 2018 é completamente diferente. A ordem cronológica importa. Sempre.
O erro que eu cometi e aprendi
Num caso envolvendo um site de golpes que usava domínios rotativos, eu segui a ordem tradicional: what, who, where, when. Levei três dias e não cheguei a lugar nenhum. O problema era que o who era um front, o what era conteúdo gerado automaticamente, e o where mudava a cada 48 horas. Só quando inverti a lógica e comecei pelo when — analisando os intervalos entre registros de novos domínios nos logs de Certificate Transparency — é que identifiquei um padrão de automação que revelou o operador real por trás de tudo. A resposta estava na frequência, não no conteúdo.
Limitações que ninguém fala
Esse método não funciona bem quando o alvo é intencionalmente opaco. Anonimato real, uso de VPNs, criptografia de ponta a ponta, domínios registrados via estruturas offshore complicadas. Nesses casos, o who e o when podem ser praticamente inacessíveis mesmo com todas as ferramentas do mundo. E o where também, porque a infraestrutura é terceirizada em múltiplas camadas. O que sobra é o what — o conteúdo em si — que muitas vezes é o único vetor viável. Você analisa o padrão de redação, erros sistemáticos, marcações temporais consistentes. Não é investigação direta, é inferência estatística. Funciona em alguns casos, falha em outros. Também tem o problema do ruído crescente. A internet tem bilhões de páginas. Buscar por what e who sem restrições adequadas gera resultados irrelevantes em volume massivo. O filtro cronológico e geográfico que o when e o where fornecem são o que torna a busca navegável. Sem eles, você perde tempo filtrando até encontrar o que precisa.
Se você quer começar com algo concreto, a primeira coisa é treinar a ordem. Escreva as quatro perguntas antes de qualquer busca. Depois, pratique com alvos simples: um domínio registrado no Brasil, um perfil público no LinkedIn, um arquivo PDF com metadados expostos. A complexidade vem depois. O que where who when é só uma estrutura. O trabalho é saber qual variável responder primeiro no seu caso específico.