O que sabemos sobre as origens da tecnologia atual
quem criou a tecnologia
A pergunta parece simples, mas quando você realmente entra nos arquivos, nos logs de commit e nas publicações acadêmicas, percebe que a resposta é bem mais emaranhada do que qualquer um costuma dizer. Eu passei anos acompanhando o desenvolvimento de modelos de linguagem e sistemas de IA, e posso afirmar com segurança que não existe um único criador. Existe um conjunto enorme de pessoas, laboratórios e ciclos de pesquisa que se sobrepõem de formas que raramente são explicadas corretamente. Se você quer entender quem criou a tecnologia por trás dos modelos atuais, precisa começar pela base: Transformer. O paper original, chamado Attention Is All You Need, foi publicado em 2017 por Vaswani e colegas do Google Brain. A arquitetura Transformer substituiu as camadas recorrentes que dominavam o campo por décadas por mecanismos de atenção pura. Isso parecia uma mudança modesta no papel, mas na prática redefiniu tudo. Sistemas como BERT, GPT e todos os subsequentes nasceram diretamente dessa ideia.
O primeiro grande modelo gerativo baseado em Transformer foi o GPT-1, lançado pela OpenAI em junho de 2018. Foram seguidos GPT-2 em 2019 e GPT-3 em 2020. Cada versão trouxe avanços significativos: mais parâmetros, mais dados de treinamento e um desempenho que ultrapassava as expectativas estabelecidas na comunidade acadêmica. Mas dizer que a OpenAI criou sozinha a tecnologia atual é simplificar demais o cenário. Vários grupos estavam trabalhando simultaneamente em problemas parecidos. Em paralelo, o Google desenvolvia BERT, RoBERTa, T5 e depois PaLM. A Meta (antiga Facebook AI) lançava LLaMA, que se tornou crucial porque era aberta e permitia que pesquisadores ao redor do mundo construíssem sobre ela. A Anthropic surgiu com Claude, trazendo uma abordagem diferente focada em alinhamento e segurança. E não podemos esquecer da DeepMind com Gemini, da Mistral AI na Europa, da xAI com Grok e de dezenas de outros laboratórios menores que também contribuíram.
O que eu vi pessoalmente durante esse período é que a linha entre pesquisa acadêmica e produto comercial é cada vez mais tênue. Muitos dos engenheiros que trabalham em empresas de IA têm doutorados ou mestrados em labs universitários. As ideias que chegam aos produtos muitas vezes vêm de artigos publicados em conferências como NeurIPS, ICML, ACL e EMNLP. Eu já vi equipes inteiras de empresas contratando justamente pesquisadores que publicarampapers específicos, não por experiência empresarial, mas por demonstrarem que entendiam profundamento como determinado mecanismo funcionava. Um detalhe que poucos mencionam: a maior parte do progresso recente não veio de uma única inovação revolucionária, mas de iterações incrementais. Aumento de escala, melhores técnicas de tokenização, datasets mais limpos, fine-tuning com RLHF ou suas variantes, quantização eficiente. Cada um desses pontos tem múltiplos contribuidores. O RLHF por exemplo, frequentemente associado à DeepMind e ao trabalho de Rafalowič e outros, teve contribuições paralelas de múltiplos grupos. A ideia básica de treinar um modelo de recompensa humano para guiar o comportamento do modelo era discutida antes mesmo de ser aplicada em larga escala.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Quando eu comecei a trabalhar diretamente com esses modelos há alguns anos, percebi algo que talvez apenas quem está no campo possa notar: a velocidade de propagação das ideias é assustadora. Um paper sai em outubro, já em dezembro tem implementações open-source, e em janeiro existem variações comerciais rodando em produção. Isso significa que rastrear a autoria original de qualquer recurso específico se torna quase impossível após um ano. O conhecimento se dilui. Eu lembro de um problema bem concreto que enfrentei ao tentar reproduzir resultados de um modelo menor baseado em LLaMA-2. A documentação oficial dizia que bastava seguir o script de fine-tuning padrão, mas na prática eu encontrava instabilidade no loss desde a terceira epoch. O que ninguém explica nos tutoriais é que o problema estava na configuração inicial do learning rate combinada com o warmup. A solução que eu encontrei foi reduzir o warmup de 1000 para 100 steps e usar um scheduler coseno em vez de linear. Isso resolveu, mas levou duas semanas de debugging porque as informações estavam espalhadas por fóruns, issues no GitHub e mensagens no Discord. Se você estiver enfrentando algo similar, saiba que não é só você.
Outro ponto que vejo as pessoas errarem constantemente é achar que mais parâmetros resolvem tudo. Na prática, um modelo de 7 bilhões de parâmetros bem treinado e finamente ajustado supera um de 13 bilhões mal ajustado em tarefas específicas. A qualidade dos dados de treino importa mais do que a quantidade, e isso sempre foi verdade, mas ficou ainda mais evidente com os grandes modelos. Dataset filtering, deduplicação, qualidade semântica, balanceamento de domínios. Tudo isso faz diferença no resultado final. Sobre quem criou a tecnologia que você usa hoje, a resposta honesta é: um ecossistema. Ninguém single-handedly criou o estado da arte. Existem fundações, governos, universidades e empresas privadas financiando pesquisas. Há contribuidores open-source que passam meses melhorando código que depois vira parte de produtos comerciais. Há estudantes de pós-graduação escrevendo teses que acabam sendo adotadas pela indústria. E há também o fato de que muitos desses avanços têm raízes em trabalho iniciado nos anos 2010, que por sua vez se baseava em pesquisa dos anos 1990 e 2000.
Se você quer entender melhor a genealogia, recomendo começar pelos papers fundacionais e depois rastrear as citações. O caminho que leva de Transformers até os modelos atuais passa por Decoding Methods, In-Context Learning, Chain-of-Thought, Retrieval-Augmented Generation e muitas outras linhas de pesquisa que continuam ativas. A tecnologia não foi criada por uma pessoa. Foi construída por centenas, e continua sendo construída todos os dias.