Olimpíada Nacional De Inteligência Artificial - Inscrições para Olimpíada Nacional de Inteligência Artificial seguem ...
Inscrições para Olimpíada Nacional de Inteligência Artificial seguem ...

Guia prático para a ONIA

A olimpíada nacional de inteligência artificial é uma competição brasileira organizada pela Sociedade Brasileira de Computação, voltada para estudantes do ensino médio que querem mostrar capacidade em raciocínio computacional e fundamentos de machine learning. O exame acontece em duas fases principais, e a primeira costuma ser mais seletiva do que os participantes imaginam no início. A segunda fase é um desafio prático onde você recebe um problema, precisa entregar código funcionando e explicar o que fez. Não é simplesmente escrever um modelo e torcer.

o que esperar da olimpíada nacional de inteligência artificial

O formato varia de edição para edição, mas na última estrutura que vi rodando, a primeira fase era objetiva com questões de lógica, matemática discretas e programação básica. Nada de Deep Learning pesado nessa fase. A banca filtra rápido quem não tem domínio de estruturas de dados antes de chegar na fase prática. Na segunda fase, o problema geralmente envolve classificação, regressão ou clustering com dataset real, e você tem autonomia para escolher a abordagem. O que mata muita gente boa é subestimar a parte de pré-processamento e validação cruzada, não o modelo em si. Uma coisa que ninguém te avisa: a nota não depende só de acertar o problema. A qualidade da entrega conta. Código limpo, comentários explicativos, separação clara entre treinamento e teste, e um relatório técnico que justifique suas escolhas. Eu vi candidato com accuracy mediana passar à frente de outro com métrica melhor porque o relatório do segundo era incompreensível. A banca quer ler seu raciocínio, não só ver um número no final.

como funciona a inscrição

A inscrição é feita pelo site da SBC, aberto geralmente entre abril e maio. Você precisa estar regularmente matriculado no ensino médio. Não há custo. Os coordenadores das escolas recebem um código de acesso e fazem a matrícula coletiva, mas também dá para fazer individualmente se sua escola não participar do processo institucional. Os resultados da primeira fase saem algumas semanas depois do fechamento das inscrições, e a divulgação dos classificados para a fase final costuma vir no final do verão.

preparação que realmente funciona

Não adianta só estudar teoria de redes neurais. A maioria dos problemas que já caíram premiou quem dominava fundamentos: árvores de decisão, random forests, SVM, k-means, validação cruzada estratificada, e principalmente limpeza de dados. O dataset muitas vezes vem sujo de propósito. Tem coluna com missing values, tipos inconsistentes, features redundantes, escala diferente por variável. Quem entra correndo pra treinar XGBoost sem olhar o chão perde tempo precioso. Eu recomendo começar treinando com datasets abertos do Kaggle que tenham categorias similares ao que a prova exige, mas o segredo é cronometrar. O tempo na fase prática é apertado e a ansiedade corta produtividade. Pratique resolver um problema completo de ponta a ponta em menos de três horas, incluindo análise exploratória, definição de baseline, tuning e escrita do relatório. O ciclo real de treino leva cerca de 45 minutos a 1h30 dependendo do hardware e da complexidade do modelo, então sobra pouco tempo para ajustes finos.

👉 Clique no botão abaixo para saber mais sobre o assunto!

stack que eu uso e recomendo

Eu rodava tudo em Python com pandas, scikit-learn, e XGBoost quando o problema pedia. LightGBM também serve bem, mas em edição anterior ele apresentou comportamento inesperado em uma task de classificação multiclasse desbalanceada e eu tive que voltar pro RandomForest. A regra geral é: leve o que você já domina, não experimente ferramenta nova no dia da prova. Ferramenta nova traz risco de edge case que você não conhece. Um detalhe técnico que poucos mencionam: a versão do scikit-learn importa. Em uma edição passada, uma função de pipeline que eu confiava tinha comportamento diferente porque a validação cruzada interna usava estratégia diferente entre versões 0.24 e 1.2. Eu perdi quase vinte minutos debugging antes de perceber que o parâmetro shuffle estava sendo interpretado de forma distinta. A solução foi fixar a versão e testar em ambiente idêntico antes de levar pro dia da prova. Hoje eu sempre uso um ambiente virtual com requirements.txt congelado e rodava um script de smoke test que valida cada dependencia antes de entrar na sala.

pitfalls comuns

O primeiro erro clássico é overfit em datasets pequenos. Quando o conjunto de treino tem menos de mil amostras, redes neurais são péssima escolha. Modelo linear com regularização forte ou floresta com profundidade controlada performa melhor e é mais rápido de validar. O segundo erro é não separar treino e teste corretamente. Dividir os dados antes de fazer seleção de features causa data leakage e infla artificialmente a métrica. Você precisa fazer o split primeiro, ajustar o preprocessing só no treino, e aplicar o mesmo transformador no teste. Outro problema frequente é ignorar o custo de computação. Submeter um modelo que leva quatro horas pra treinar em uma prova de três horas é receita para entregar nada. Eu ajusto meu pipeline pra rodar cross-validation com três folds e grid search com no máximo vinte combinações, o que em máquina comum dura entre doze e dezoito minutos. Se o problema pede algo mais robusto, eu priorizo modelos mais simples com validação mais rigorosa do que modelos complexos mal avaliados.

recurso oficial

As informações oficiais, editais, provas anteriores e editais atualizados ficam disponíveis no site da SBC. A URL principal é sbc.org.br. Lá você baixa o edital da edição vigente, encontra link de inscrição, e acessa o banco de provas passadas com gabaritos quando disponíveis. Não existe repositório único de datasets oficiais porque a banca costuma gerar arquivos novos a cada ano, mas os arquivos de provas anteriores servem como referência sólida de nível e estilo.

limitações dessa prova

A ONIA não avalia implementação de zero. Ela testa capacidade de aplicação, não engenharia de produção. Se seu objetivo é entrar no mercado e mostrar skills de deploy, MLOps ou escalonamento, essa competição não vai te preparar diretamente. O formato premia velocidade e raciocínio sob restrições de tempo, não qualidade de software em longo prazo. Também não cobre temas emergentes como LLMs ou reinforcement learning de forma estruturada, então quem chega esperando vai encontrar lacuna. Se esse é seu foco, complementa com competições como os challenges do Kaggle ou projetos de pesquisa aplicados. O que funciona de verdade é pratica deliberada com tempo limitado, ambiente reproduzível, e leitura crítica dos resultados. Se você entrar sabendo que o problema real não é o modelo, mas o processo todo ao redor dele, sua probabilidade de avançar melhora bastante.