18 modèles d'IA se sont lancés dans une course à la recherche entièrement autonome – le Kimi K3 à poids ouvert a presque rattrapé Claude
Prime Intellect vient de mener une expérience inhabituelle : 18 modèles de langage de premier plan – de Fable 5 et GPT-5.6 Sol au Kimi K3 à poids ouvert – ont été lâchés lors de recherches autonomes dans lesquelles les humains ne sont jamais intervenus. La fin est bruyante : un modèle chinois ouvert câblé à un harnais d'agent bon marché s'est approché à portée de main du produit phare le plus cher d'Anthropic. Voici ce qui s’est passé et pourquoi c’est important pour quiconque suit les progrès de l’IA.
La course : entraîner un modèle en le moins d’étapes possible
La tâche vient du célèbre projet speedrun nanoGPT d'Andrej Karpathy. Un petit modèle de 124 millions de paramètres doit atteindre une perte de validation de 3,28, en utilisant le moins d'étapes de formation possible. La recette de démarrage y parvient en 3 290 étapes. Le mieux que les humains aient réussi est de 2 600.
L'agent reçoit un référentiel de code, un petit livre de règles et un objectif. Après cela, c'est tout seul : peaufiner l'optimiseur, exécuter des expériences, déterminer une réelle amélioration à partir du bruit aléatoire, décider quoi tester ensuite. Matériel : huit GPU H200, le tout verrouillé dans un bac à sable hors ligne afin que le modèle ne puisse pas rechercher de réponses toutes prêtes. Au total, il y a eu 153 parcours entièrement autonomes ; le plus long a duré huit jours.
Qui a fini où
Fable 5 d'Anthropic est allé le plus loin avec 2 726 étapes, comblant environ 82 % de l'écart entre la recette de base et le dossier humain. Le produit phare Claude Opus 5 a franchi la ligne d'arrivée à 2 920 unités.
Puis vint la surprise. Le Kimi K3 à poids ouvert de Moonshot AI, fonctionnant via le harnais multi-agents Prime Agent, s'est arrêté à 2 930 étapes. Dix pas derrière un produit phare qui coûte nettement plus cher par jeton. GPT-5.6 Sol a terminé à 3 042 – derrière le modèle ouvert.

Le plus drôle : personne n’a rien inventé de nouveau
Pas un seul essai n’a produit une méthode véritablement nouvelle. Tout ce qui a réellement fonctionné – des normalisations intelligentes, des programmes de taux d’apprentissage, une moyenne de poids – a été décrit dans des articles il y a des années. Chaque modèle a convergé vers le même sac d’idées.
La différence était l'exécution. Les modèles plus solides n’enterrent pas une hypothèse après un mauvais lancer : ils modifient la graine aléatoire, répètent les mesures, revisitent les vieilles idées une fois que les conditions changent. Ils séparent plus soigneusement les progrès réels du bruit. Et ils construisent leurs propres outils : Kimi K3 a écrit des fonctions personnalisées pour comparer les courbes de perte et a assemblé un mini laboratoire numérique, validant la méthode Newton-Schulz sur des caisses de jouets avant de la transformer en véritable formation.
Pourquoi cela endommage le script « AI améliorant l'IA »
L'histoire classique de l'auto-amélioration récursive se déroule comme suit : le modèle fermé le plus intelligent commence à se mettre à niveau et s'éloigne de manière irréversible pendant que tous les autres mangent de la poussière. Cette expérience efface cette image. Lorsque les idées s'épuisent rapidement, le gagnant n'est pas le joueur le plus intelligent mais celui dont la boucle « proposer – tester – rejeter » coûte moins cher et tourne plus vite. Les modèles ouverts pilotés par un bon harnais effectuent plus de tentatives par dollar – et cela s’avère plus important qu’un autre point de référence.
Le piège
Pour être honnête : il s’agit là d’une tâche très limitée. Un seul script de formation, une mesure claire, un critère de réussite sans ambiguïté : la vraie science semble bien plus compliquée. Aucune nouvelle méthode n'a vu le jour non plus, il s'agit donc toujours d'automatiser la routine d'un chercheur plutôt que de remplacer le chercheur. Et les résultats dépendent fortement du harnais lui-même : le même Kimi K3 sans la couche d'agent fonctionne nettement moins bien.
FAQ
Qu'est-ce qu'un harnais d'agent ?
Une couche autour du modèle : des outils, un environnement d'exécution de code, une mémoire des étapes précédentes, un planificateur de tâches. Le modèle reste le même, mais le travail devient plus facile, comme si une personne obtenait un bon bureau avec les outils appropriés.
Les utilisateurs réguliers peuvent-ils essayer Kimi K3 ?
Oui, les poids sont ouverts. Vous pouvez discuter avec lui dansBavarderet essayez les workflows de type agent dansCode.
Alors, l’IA va-t-elle bientôt rédiger elle-même des articles scientifiques ?
Pas si vite. Les agents autonomes réussissent bien lorsqu'il existe des mesures précises et des commentaires rapides. Les hypothèses, le goût et se poser les bonnes questions restent un territoire humain. Mais l’infrastructure autour des modèles est mise à niveau plus rapidement que toute autre chose à l’heure actuelle – ce qui mérite d’être surveillé.