18 modelos AI entraram em uma corrida de pesquisa totalmente autônoma – peso aberto Kimi K3 quase capturado Claude
A Prime Intellect acaba de realizar um experimento incomum: 18 modelos de linguagem de ponta – do Fable 5 e GPT-5.6 Sol ao peso aberto Kimi K3 – foram soltos em pesquisas autônomas onde os humanos nunca intervieram. Aqui está o que aconteceu e por que isso é importante para quem acompanha o progresso do AI.
A corrida: treinar um modelo no menor número de etapas possível
A tarefa vem do conhecido projeto nanoGPT speedrun de Andrej Karpathy. Um pequeno modelo de 124 milhões de parâmetros precisa atingir uma perda de validação de 3,28 — usando o mínimo possível de etapas de treinamento. A receita inicial chega lá em 3.290 etapas. O melhor que os humanos conseguiram é 2.600.
O agente recebe um repositório de código, um pequeno livro de regras e um objetivo. Depois disso, é por conta própria: ajustar o otimizador, executar experimentos, detectar melhorias reais a partir de ruídos aleatórios, decidir o que testar em seguida. Hardware: oito GPUs H200, tudo trancado em uma sandbox offline para que o modelo não possa procurar respostas prontas. No total foram 153 corridas totalmente autônomas; o mais longo durou oito dias.
Quem terminou onde
O Fable 5 da Anthropic foi mais longe com 2.726 passos, fechando cerca de 82% da lacuna entre a receita básica e o registro humano. O carro-chefe Claude Opus 5 cruzou a linha em 2.920.
Então veio a surpresa. Peso aberto Kimi K3 de Moonshot AI, passando pelo multiagente Prime Agent Harness, parou em 2.930 passos. Dez passos atrás de um carro-chefe que custa visivelmente mais por token. GPT-5.6 Sol terminou em 3.042 – atrás do modelo aberto.

A parte mais engraçada: ninguém inventou nada de novo
Nem uma única execução produziu um método genuinamente novo. Tudo o que realmente funcionou – normalizações inteligentes, cronogramas de taxas de aprendizagem, média de peso – foi descrito em artigos anos atrás. Cada modelo convergiu aproximadamente para o mesmo conjunto de ideias.
A diferença foi a execução. Modelos mais fortes não enterram uma hipótese após uma jogada ruim: eles mudam a semente aleatória, repetem medições, revisitam ideias antigas quando as condições mudam. Eles separam o progresso real do ruído com mais cuidado. E eles construíram suas próprias ferramentas: Kimi K3 escreveram funções personalizadas para comparar curvas de perda e montaram um minilaboratório numérico, validando o método Newton-Schulz em caixas de brinquedo antes de transferi-lo para o treinamento real.
Por que isso prejudica o script "AI melhorando AI"
A clássica história recursiva de autoaperfeiçoamento é mais ou menos assim: o modelo fechado mais inteligente começa a se atualizar e se afasta irreversivelmente enquanto todos os outros comem poeira. Este experimento desfaz essa imagem. Quando as ideias se esgotam rapidamente, o vencedor não é o jogador mais inteligente, mas aquele cujo ciclo de “propor – testar – descartar” custa menos e gira mais rápido. Modelos abertos impulsionados por um bom aproveitamento realizam mais tentativas por dólar – e isso acaba sendo mais importante do que qualquer outro ponto de referência.
A captura
Para ser justo: esta é uma tarefa muito restrita. Um único roteiro de treinamento, uma métrica clara, um critério de sucesso inequívoco – a ciência real parece muito mais confusa. Também não surgiram novos métodos, pelo que se trata ainda de automatizar a rotina de um investigador, em vez de substituí-lo. E os resultados dependem fortemente do próprio chicote: o mesmo Kimi K3 sem a camada de agente funciona visivelmente pior.
Perguntas frequentes
O que é um chicote de agente?
Uma camada em torno do modelo: ferramentas, ambiente de execução de código, memória de etapas anteriores, agendador de tarefas. O modelo permanece o mesmo, mas o trabalho se torna mais fácil – como se uma pessoa conseguisse uma mesa adequada com as ferramentas adequadas.
Os usuários regulares podem tentar Kimi K3?
Sim, os pesos estão abertos. Você pode conversar com ele em NeuralSpace Bate-papo e experimente fluxos de trabalho estilo agente em Código.
Então, o AI escreverá artigos científicos por conta própria em breve?
Não tão rápido. Agentes autônomos funcionam bem quando há métricas precisas e feedback rápido. Hipóteses, gosto e perguntas certas ainda são território humano. Mas a infraestrutura em torno dos modelos está sendo atualizada mais rapidamente do que qualquer outra coisa no momento – vale a pena ficar de olho.