18 AI-modeller deltog i et fuldt autonomt forskningsløb - Kimi K3 med åben vægt fangede næsten Claude
Prime Intellect har lige kørt et usædvanligt eksperiment: 18 topsprogsmodeller – fra Fable 5 og GPT-5.6 Sol til åbenvægts Kimi K3 – blev sat løs på autonome forskningskørsler, hvor mennesker aldrig trådte ind. Slutningen er højlydt: En åben kinesisk model koblet til en billig agentsele kom inden for berøringsafstand fra Anthropics dyreste flagskib. Her er, hvad der skete, og hvorfor det er vigtigt for alle, der sporer AI-fremskridt.
Løbet: Træn en model i så få trin som muligt
Opgaven kommer fra Andrej Karpathys velkendte nanoGPT speedrun-projekt. En lille model med 124 millioner parametre skal nå et valideringstab på 3,28 — ved at bruge så få træningstrin som muligt. Startopskriften kommer dertil i 3.290 trin. Det bedste mennesker har klaret er 2.600.
Agenten modtager et kodelager, en kort regelbog og et mål. Derefter er det på egen hånd: tweaking optimizer, køre eksperimenter, fortælle reel forbedring fra tilfældig støj, beslutte, hvad der skal teste næste. Hardware: otte H200 GPU'er, alt låst inde i en offline sandkasse, så modellen ikke kan finde klar svar. I alt var der 153 fuldt autonome kørsler; den længste strakte sig over otte dage.
Hvem blev færdig hvor
Anthropic's Fable 5 gik længst med 2.726 trin, og lukkede omkring 82% af kløften mellem baseline-opskriften og den menneskelige rekord. Flagskibet Claude Opus 5 krydsede stregen ved 2.920.
Så kom overraskelsen. Open-weight Kimi K3 fra Moonshot AI, der kørte gennem multi-agent Prime Agent Harness, stoppede ved 2.930 skridt. Ti trin bag et flagskib, der koster mærkbart mere pr. token. GPT-5.6 Sol endte på 3.042 — bag den åbne model.

Den sjoveste del: ingen har opfundet noget nyt
Ikke en eneste kørsel producerede en virkelig ny metode. Alt, hvad der rent faktisk fungerede - smarte normaliseringer, skemaer for indlæringshastighed, vægtgennemsnit - blev beskrevet i aviser for år siden. Hver model konvergerede på nogenlunde den samme pose ideer.
Forskellen var udførelse. Stærkere modeller begraver ikke en hypotese efter et dårligt kast: de ændrer det tilfældige frø, gentager målinger, gentager gamle ideer, når forholdene skifter. De adskiller reelt fremskridt fra støj mere omhyggeligt. Og de bygger deres egne værktøjer: Kimi K3 skrev brugerdefinerede funktioner til at sammenligne tabskurver og samlede et mini-numerisk laboratorium, der validerede Newton-Schulz-metoden på legetøjssager, før den flyttede til rigtig træning.
Hvorfor dette forstyrrer "AI-forbedrende AI"-scriptet
Den klassiske rekursive selvforbedringshistorie går sådan her: Den smarteste lukkede model begynder at opgradere sig selv og trækker sig irreversibelt væk, mens alle andre spiser støv. Dette eksperiment afskærer billedet. Når ideer løber hurtigt tør, er vinderen ikke den smarteste spiller, men den, hvis løkke med "foreslå — test — kassere" koster mindre og spinder hurtigere. Åbne modeller drevet af en god sele kører flere forsøg pr. dollar - og det viser sig at betyde mere end endnu et benchmark-punkt.
Fangsten
For at være retfærdig: dette er en meget snæver opgave. Et enkelt træningsmanuskript, én klar metrik, et utvetydigt succeskriterium – rigtig videnskab ser langt mere rodet ud. Der dukkede heller ikke nye metoder op, så det handler stadig om at automatisere en forskers rutine frem for at erstatte forskeren. Og resultaterne afhænger meget af selve selen: den samme Kimi K3 uden agentlaget kører mærkbart dårligere.
FAQ
Hvad er en agent sele?
Et lag omkring modellen: værktøjer, et kodeudførelsesmiljø, hukommelse af tidligere trin, en opgaveplanlægger. Modellen forbliver den samme, men arbejdet bliver lettere - ligesom en person får et ordentligt skrivebord med det rigtige værktøj.
Kan almindelige brugere prøve Kimi K3?
Ja, vægtene er åbne. Du kan chatte med den iNeuralSpace Chatog prøv agent-stil arbejdsgange indKode.
Så vil AI snart skrive videnskabelige artikler på egen hånd?
Ikke så hurtigt. Autonome agenter klarer sig godt, hvor der er en skarp metrisk og hurtig feedback. Hypoteser, smag og at stille de rigtige spørgsmål er stadig menneskeligt territorium. Men infrastrukturen omkring modeller bliver opgraderet hurtigere end noget andet lige nu - værd at holde øje med.