← Alla artiklar

18 AI-modeller deltog i ett helt autonomt forskningslopp - Kimi K3 med öppen vikt fångade nästan Claude

18 AI-modeller deltog i ett helt autonomt forskningslopp - Kimi K3 med öppen vikt fångade nästan Claude

Prime Intellect körde precis ett ovanligt experiment: 18 toppspråksmodeller – från Fable 5 och GPT-5.6 Sol till öppenvikts Kimi K3 – släpptes på autonoma forskningskörningar där människor aldrig gick in. Slutet är högljutt: en öppen kinesisk modell kopplad till en billig agentsele kom inom beröringsavstånd från Anthropics dyraste flaggskepp. Här är vad som hände och varför det är viktigt för alla som spårar AI-framsteg.

Loppet: träna en modell i så få steg som möjligt

Uppgiften kommer från Andrej Karpathys välkända nanoGPT speedrun-projekt. En liten modell med 124 miljoner parametrar måste nå en valideringsförlust på 3,28 — med så få träningssteg som möjligt. Förrättsreceptet når dit i 3 290 steg. Det bästa människorna har klarat av är 2 600.

Agenten får ett kodlager, en kort regelbok och ett mål. Efter det är det på egen hand: justera optimeraren, köra experiment, berätta verklig förbättring från slumpmässigt brus, bestämma vad som ska testas härnäst. Hårdvara: åtta H200 GPU:er, allt låst i en offline-sandlåda så att modellen inte kan hitta färdiga svar. Totalt fanns det 153 helt autonoma körningar; den längsta sträckte sig över åtta dagar.

Vem slutade var

Anthropics Fable 5 gick längst med 2 726 steg, och stängde cirka 82 % av gapet mellan baslinjereceptet och det mänskliga rekordet. Flaggskeppet Claude Opus 5 passerade gränsen på 2 920.

Sedan kom överraskningen. Kimi K3 med öppen vikt från Moonshot AI, som körde genom multiagenten Prime Agent Harness, stannade vid 2 930 steg. Tio steg bakom ett flaggskepp som kostar märkbart mer per token. GPT-5.6 Sol slutade på 3 042 — bakom den öppna modellen.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Det roligaste: ingen hittade på något nytt

Inte en enda körning gav en verkligt ny metod. Allt som faktiskt fungerade - smarta normaliseringar, inlärningshastighetsscheman, viktgenomsnitt - beskrevs i tidningar för flera år sedan. Varje modell konvergerade på ungefär samma påse med idéer.

Skillnaden var utförande. Starkare modeller begraver inte en hypotes efter en dålig roll: de ändrar det slumpmässiga fröet, upprepar mätningar, återvänder till gamla idéer när förhållandena ändras. De skiljer verkliga framsteg från buller mer noggrant. Och de bygger sina egna verktyg: Kimi K3 skrev anpassade funktioner för att jämföra förlustkurvor och satte ihop ett mini-numeriskt labb, som validerade Newton-Schulz-metoden på leksaksfodral innan den flyttade till riktig träning.

Varför detta gör att skriptet "AI-förbättrande AI" skadas

Den klassiska rekursiva självförbättringshistorien går så här: den smartaste stängda modellen börjar uppgradera sig själv och drar sig oåterkalleligt medan alla andra äter damm. Det här experimentet tar bort den bilden. När idéerna tar slut snabbt är vinnaren inte den smartaste spelaren utan den vars loop av "föreslå — testa — kassera" kostar mindre och snurrar snabbare. Öppna modeller som drivs av en bra sele kör fler försök per dollar - och det visar sig vara viktigare än en annan riktmärke.

Fångsten

För att vara rättvis: detta är en mycket snäv uppgift. Ett enda träningsmanus, ett tydligt mått, ett otvetydigt framgångskriterium – verklig vetenskap ser mycket rörigare ut. Inga nya metoder dök upp heller, så det handlar fortfarande om att automatisera en forskares rutin snarare än att ersätta forskaren. Och resultatet hänger mycket på själva selen: samma Kimi K3 utan agentskiktet går märkbart sämre.

FAQ

Vad är en agentsele?

Ett lager runt modellen: verktyg, en kodexekveringsmiljö, minne av tidigare steg, en uppgiftsschemaläggare. Modellen förblir densamma, men arbetet blir lättare - som att en person får ett ordentligt skrivbord med rätt verktyg.

Kan vanliga användare prova Kimi K3?

Ja, vikterna är öppna. Du kan chatta med den iNeuralSpace Chatoch prova arbetsflöden i agentstilKoda.

Så kommer AI att skriva vetenskapliga artiklar på egen hand snart?

Inte så snabbt. Autonoma agenter klarar sig bra där det finns ett skarpt mått och snabb feedback. Hypoteser, smak och att ställa de rätta frågorna är fortfarande mänskligt territorium. Men infrastrukturen kring modeller uppgraderas snabbare än något annat just nu - värt att hålla ett öga på.