← Alle artikelen

18 AI-modellen deden mee aan een volledig autonome onderzoeksrace – Kimi K3 met open gewicht pakte Claude bijna

18 AI-modellen deden mee aan een volledig autonome onderzoeksrace – Kimi K3 met open gewicht pakte Claude bijna

Prime Intellect heeft zojuist een ongebruikelijk experiment uitgevoerd: 18 toptaalmodellen – van Fable 5 en GPT-5.6 Sol tot open-weight Kimi K3 – werden losgelaten op autonome onderzoeksruns waar mensen nooit tussenbeide kwamen. Het einde is luid: een open Chinees model aangesloten op een goedkoop agentenharnas kwam binnen handbereik van het duurste vlaggenschip van Anthropic. Dit is wat er is gebeurd en waarom het belangrijk is voor iedereen die de voortgang van AI volgt.

De race: train een model in zo weinig mogelijk stappen

De taak komt uit het bekende nanoGPT speedrun-project van Andrej Karpathy. Een klein model met 124 miljoen parameters moet een validatieverlies van 3,28 bereiken – met zo min mogelijk trainingsstappen. Het startrecept komt er in 3.290 stappen. Het beste aantal mensen dat erin geslaagd is, is 2.600.

De agent ontvangt een coderepository, een kort rulebook en één doel. Daarna staat het op zichzelf: de optimalisatie aanpassen, experimenten uitvoeren, echte verbetering uit willekeurige ruis vertellen, beslissen wat er vervolgens moet worden getest. Hardware: acht H200 GPU's, alles opgesloten in een offline sandbox, zodat het model geen kant-en-klare antwoorden kan opzoeken. In totaal waren er 153 volledig autonome ritten; het langste duurde de afgelopen acht dagen.

Wie waar eindigde

Anthropic's Fable 5 ging het verst met 2.726 stappen, waarmee ongeveer 82% van de kloof tussen het basisrecept en het menselijke record werd gedicht. Het vlaggenschip Claude Opus 5 kwam met 2.920 over de streep.

Toen kwam de verrassing. Kimi K3 met open gewicht van Moonshot AI, die door het Prime Agent-harnas met meerdere agenten liep, stopte bij 2.930 stappen. Tien stappen achter een vlaggenschip dat merkbaar meer kost per token. GPT-5.6 Sol eindigde op 3.042 – achter het open model.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Het grappigste: niemand heeft iets nieuws uitgevonden

Geen enkele run leverde een werkelijk nieuwe methode op. Alles wat echt werkte – slimme normalisaties, leertemposchema’s, gewichtsmiddeling – werd jaren geleden in artikelen beschreven. Elk model kwam samen op ongeveer dezelfde ideeënzak.

Het verschil was de uitvoering. Sterkere modellen begraven een hypothese niet na één slechte worp: ze veranderen het willekeurige zaad, herhalen metingen en komen terug op oude ideeën zodra de omstandigheden veranderen. Ze scheiden echte vooruitgang zorgvuldiger van lawaai. En ze bouwen hun eigen tools: Kimi K3 schreef aangepaste functies voor het vergelijken van verliescurven en stelde een mini-numeriek laboratorium samen, waarbij de Newton-Schulz-methode op speelgoedkoffers werd gevalideerd voordat deze in echte training werd omgezet.

Waarom dit het 'AI verbeterende AI'-script deukt

Het klassieke verhaal over recursieve zelfverbetering gaat als volgt: het slimste gesloten model begint zichzelf te upgraden en trekt zich onomkeerbaar terug terwijl alle anderen stof eten. Dit experiment vernietigt dat beeld. Als ideeën snel opraken, is de winnaar niet de slimste speler, maar degene wiens lus van 'voorstellen - testen - weggooien' minder kost en sneller draait. Open modellen, aangedreven door een goed harnas, voeren meer pogingen per dollar uit – en dat blijkt belangrijker te zijn dan een ander ijkpunt.

De vangst

Om eerlijk te zijn: dit is een zeer beperkte taak. Eén enkel trainingsscript, één duidelijke maatstaf, een ondubbelzinnig succescriterium: echte wetenschap ziet er veel rommeliger uit. Er zijn ook geen nieuwe methoden ontstaan, dus het gaat nog steeds om het automatiseren van de routine van een onderzoeker en niet om het vervangen van de onderzoeker. En de resultaten zijn sterk afhankelijk van het harnas zelf: dezelfde Kimi K3 zonder de agentlaag loopt merkbaar slechter.

Veelgestelde vragen

Wat is een agentenharnas?

Een laag rond het model: tools, een code-uitvoeringsomgeving, geheugen van eerdere stappen, een taakplanner. Het model blijft hetzelfde, maar werken wordt gemakkelijker – alsof iemand een goed bureau krijgt met het juiste gereedschap.

Kunnen gewone gebruikers Kimi K3 proberen?

Ja, de gewichten zijn open. Je kunt ermee chattenNeuralSpace-chaten probeer workflows in agentstijl uitCode.

Zal AI binnenkort zelf wetenschappelijke artikelen schrijven?

Niet zo snel. Autonome agenten doen het goed als er duidelijke meetgegevens en snelle feedback zijn. Hypotheses, smaak en het stellen van de juiste vragen zijn nog steeds menselijk terrein. Maar de infrastructuur rond modellen wordt momenteel sneller geüpgraded dan wat dan ook – de moeite waard om in de gaten te houden.