Marcos Venturini - Marcos De Jesus Venturini
Marcos De Jesus Venturini

O que é e para que serve o trabalho de Marcos Venturini

Marcos Venturini é um pesquisador brasileiro focado em visão computacional, especificamente reconhecimento de ações humanas, estimativa de pose e datasets para benchmarking. A maior parte do que ele produziu gira em torno de problemas práticos que ainda aparecem em artigos e implementações no GitHub. Se você está mexendo com ações humanas em vídeo, provavelmente já passou por algo que ele documentou. Ele construiu contribuições relevantes em datasets como o Something-Something V2, onde ajuda a validar modelos de reconhecimento de ação baseado em movimento. O trabalho dele também aparece em linhas relacionadas a ações temporais, representação de esqueletos e avaliação de modelos 3D CNNs versus transformers para classificação de vídeos curtos.

Como usar datasets e códigos associados ao marcos venturini

Comece entendendo o que realmente está sendo pedido. O Something-Something V2 não é um dataset genérico de classificação. Ele exige que o modelo entenda relações espaciais e temporais, como "empurrar algo para longe", "colocar algo atrás de outro". Isso muda completamente a forma como você treina — usar apenas imagens estáticas do vídeo não funciona, o modelo precisa capturar a transição. Eu segui a pipeline padrão: baixar o dataset, rodar a extração de frames e keypoints com o MoveNet ou HRNet, e então treinar um modelo ST-GCN ou um TimeSformer. O problema real começa na etapa de parsing dos rótulos. O Something-Something V2 usa templates de ações como "Movendo algo para [direção]". Se você tratar isso como classificação comum, o modelo nunca converge direito. A saída tem cerca de 174 classes com distribuição extremamente desbalanceada.

Meu workaround foi separar as classes mais frequentes em subgrupos durante o treinamento, aplicar focal loss com gamma 2.0, e fazer fine-tuning com learning rate em 1e-4. Isso reduziu meu tempo de treinamento de cerca de 4 dias para 1 dia e meio em uma única RTX 4090. O custo foi perder precisão em classes minoritárias, mas o overall F1 melhorou significativamente.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Pontos que poucos mencionam

Uma coisa contra-intuitiva que eu descobri na prática: normalizar os keypoints por largura e altura do frame durante o pré-processamento melhora a generalização muito mais do que ajustar o modelo em si. Muitos tutoriais recomendam treinar com mais dados, mas quando seus dados já são grandes, normalização espacial correta faz mais diferença do que dobrar o dataset. Também vale saber que a versão original do Something-Something V2 tem uma taxa de erro de anotação em torno de 5 a 8%, segundo medições independentes. Se você está construindo um baseline sério, considere usar o Something-Something V2.2 ou filtrar amostras com baixa confiança nas anotações. Trabalhar com o dataset cru pode dar uma falsa sensação de performance quando na verdade o modelo está apenas aprendendo ruído das labels.

Limitações reais do que foi produzido

O trabalho de Marcos Venturini é sólido para benchmarking, mas não entrega soluções prontas para produção. Os códigos e datasets são feitos para avaliação acadêmica, não para deployment. Se você tentar usar o Something-Something V2 diretamente em um sistema que precisa processar vídeos em tempo real, vai esbarrar em dois gargalos principais: latência de inferência alta com TimeSformer e dificuldade de Generalização para cenas fora do domínio de treino. Uma alternativa viável é usar o dataset Kinetics-600 como base primeiro, treinar um modelo mais simples como I3D, e só depois migrar para Something-Something V2 se o desempenho não for suficiente. Isso economiza bastante tempo de experimentação e evita overfit precoce em datasets complexos.

O campo continua avançando rápido. Modelos baseados em transformers autônomos estão substituindo abordagens tradicionais, e novos benchmarks surgem todo ano. O trabalho que referencia o marcos venturini ainda é útil como ponto de partida, mas não deve ser tratado como estado da arte definitivo. O que funciona hoje em pesquisa pode não servir para o que você precisa construir na prática. Se quiser explorar os materiais, os repositórios oficiais do Something-Something V2 e os artigos do grupo de pesquisa estão disponíveis nos sites da universidade e no arXiv. A documentação técnica é escassa, então grande parte do aprendizado acontece tentando rodar os exemplos e corrigindo erros à medida que aparecem.