18 modelos de IA participaron en una carrera de investigación totalmente autónoma: el Kimi K3 de peso abierto casi alcanza a Claude
Prime Intellect acaba de realizar un experimento inusual: 18 modelos de lenguajes de primer nivel, desde Fable 5 y GPT-5.6 Sol hasta el Kimi K3 de peso abierto, se liberaron en investigaciones autónomas en las que los humanos nunca intervinieron. El final es ruidoso: un modelo chino abierto conectado a un arnés de agente barato se acercó al buque insignia más caro de Anthropic. Esto es lo que sucedió y por qué es importante para cualquiera que siga el progreso de la IA.
La carrera: entrenar un modelo en el menor número de pasos posible
La tarea proviene del conocido proyecto nanoGPT speedrun de Andrej Karpathy. Un modelo pequeño de 124 millones de parámetros tiene que alcanzar una pérdida de validación de 3,28, utilizando la menor cantidad de pasos de entrenamiento posible. La receta inicial se consigue en 3290 pasos. Lo mejor que han logrado los humanos es 2.600.
El agente recibe un depósito de códigos, un breve libro de reglas y un objetivo. Después de eso, todo está solo: ajustar el optimizador, realizar experimentos, detectar mejoras reales a partir del ruido aleatorio y decidir qué probar a continuación. Hardware: ocho GPU H200, todo bloqueado dentro de una zona de pruebas fuera de línea para que el modelo no pueda buscar respuestas listas. En total hubo 153 ejecuciones totalmente autónomas; el más largo duró ocho días.
quien termino donde
Fable 5 de Anthropic llegó más lejos con 2.726 pasos, cerrando aproximadamente el 82% de la brecha entre la receta básica y el registro humano. El buque insignia Claude Opus 5 cruzó la línea a 2.920.
Luego vino la sorpresa. El Kimi K3 de peso abierto de Moonshot AI, corriendo a través del Prime Agent Harness de múltiples agentes, se detuvo en 2930 pasos. Diez pasos detrás de un buque insignia que cuesta notablemente más por token. GPT-5.6 Sol terminó en 3.042, detrás del modelo abierto.

La parte más divertida: nadie inventó nada nuevo.
Ni un solo experimento produjo un método genuinamente novedoso. Todo lo que realmente funcionó (normalizaciones inteligentes, programas de tasas de aprendizaje, promedios de peso) se describió en artículos hace años. Todos los modelos convergieron aproximadamente en el mismo conjunto de ideas.
La diferencia fue la ejecución. Los modelos más sólidos no entierran una hipótesis después de una mala tirada: cambian la semilla aleatoria, repiten mediciones y revisan viejas ideas una vez que cambian las condiciones. Separan más cuidadosamente el progreso real del ruido. Y construyen sus propias herramientas: Kimi K3 escribió funciones personalizadas para comparar curvas de pérdida y montó un mini laboratorio numérico, validando el método Newton-Schulz en cajas de juguetes antes de trasladarlo al entrenamiento real.
Por qué esto afecta el guión "La IA mejora la IA"
La clásica historia recursiva de superación personal es la siguiente: el modelo cerrado más inteligente comienza a mejorarse y se aleja irreversiblemente mientras todos los demás comen polvo. Este experimento destruye esa imagen. Cuando las ideas se agotan rápidamente, el ganador no es el jugador más inteligente sino aquel cuyo ciclo de "proponer - probar - descartar" cuesta menos y gira más rápido. Los modelos abiertos impulsados por un buen arnés ejecutan más intentos por dólar, y eso resulta ser más importante que otro punto de referencia.
la captura
Para ser justos: ésta es una tarea muy limitada. Un único guión de entrenamiento, una métrica clara, un criterio de éxito inequívoco: la ciencia real parece mucho más confusa. Tampoco surgieron nuevos métodos, por lo que todavía se trata de automatizar la rutina del investigador en lugar de reemplazarlo. Y los resultados dependen en gran medida del arnés en sí: el mismo Kimi K3 sin la capa de agente funciona notablemente peor.
Preguntas frecuentes
¿Qué es un arnés de agente?
Una capa alrededor del modelo: herramientas, un entorno de ejecución de código, memoria de pasos anteriores, un programador de tareas. El modelo sigue siendo el mismo, pero trabajar se vuelve más fácil, como si una persona tuviera un escritorio adecuado con las herramientas adecuadas.
¿Pueden los usuarios habituales probar Kimi K3?
Sí, las pesas están abiertas. Puedes chatear con él enChat NeuralSpacey pruebe flujos de trabajo estilo agente enCódigo.
Entonces, ¿la IA pronto escribirá artículos científicos por sí sola?
No tan rápido. A los agentes autónomos les va bien cuando hay una métrica nítida y una retroalimentación rápida. Las hipótesis, el gusto y las preguntas adecuadas siguen siendo territorio humano. Pero la infraestructura alrededor de los modelos se está actualizando más rápido que cualquier otra cosa en este momento; vale la pena estar atento.