← Alle artikler

18 AI-modeller deltok i et fullstendig autonomt forskningsløp - Kimi K3 med åpen vekt fanget nesten Claude

18 AI-modeller deltok i et fullstendig autonomt forskningsløp - Kimi K3 med åpen vekt fanget nesten Claude

Prime Intellect kjørte nettopp et uvanlig eksperiment: 18 toppspråkmodeller – fra Fable 5 og GPT-5.6 Sol til åpenvekts Kimi K3 – ble satt løs på autonome forskningsløp der mennesker aldri gikk inn. Slutten er høylytt: En åpen kinesisk modell koblet til en billig agentsele kom innen berøringsavstand fra Anthropics dyreste flaggskip. Her er hva som skjedde, og hvorfor det er viktig for alle som sporer AI-fremgang.

Løpet: tren en modell i så få trinn som mulig

Oppgaven kommer fra Andrej Karpathys velkjente nanoGPT speedrun-prosjekt. En liten modell med 124 millioner parametere må nå et valideringstap på 3,28 — ved å bruke så få treningstrinn som mulig. Startoppskriften kommer dit i 3.290 trinn. Det beste menneskene har klart er 2600.

Agenten mottar et kodelager, en kort regelbok og ett mål. Etter det er det på egen hånd: finjustering av optimizeren, kjører eksperimenter, forteller reell forbedring fra tilfeldig støy, bestemmer hva du skal teste neste gang. Maskinvare: åtte H200 GPUer, alt låst inne i en offline sandkasse slik at modellen ikke kan finne klare svar. Totalt var det 153 helt autonome løyper; den lengste strakte seg over åtte dager.

Hvem fullførte hvor

Anthropics Fable 5 gikk lengst med 2726 trinn, og lukket omtrent 82 % av gapet mellom grunnlinjeoppskriften og den menneskelige rekorden. Flaggskipet Claude Opus 5 krysset linjen på 2.920.

Så kom overraskelsen. Åpenvekts Kimi K3 fra Moonshot AI, som løp gjennom multiagenten Prime Agent Harness, stoppet ved 2930 trinn. Ti skritt bak et flaggskip som koster merkbart mer per token. GPT-5.6 Sol endte på 3.042 — bak den åpne modellen.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Den morsomste delen: ingen fant opp noe nytt

Ikke en eneste kjøring produserte en genuint ny metode. Alt som faktisk fungerte - smarte normaliseringer, læringshastighetsplaner, vektgjennomsnitt - ble beskrevet i aviser for mange år siden. Hver modell konvergerte på omtrent samme pose med ideer.

Forskjellen var utførelse. Sterkere modeller begraver ikke en hypotese etter en dårlig kast: de endrer det tilfeldige frøet, gjentar målinger, ser tilbake på gamle ideer når forholdene endrer seg. De skiller reell fremgang fra støy mer nøye. Og de bygger sine egne verktøy: Kimi K3 skrev tilpassede funksjoner for å sammenligne tapskurver og satte sammen et mini numerisk laboratorium, som validerte Newton-Schulz-metoden på leketøyssaker før den flyttet til ekte trening.

Hvorfor dette forstyrrer "AI-forbedrende AI"-skriptet

Den klassiske rekursive selvforbedringshistorien går slik: Den smarteste lukkede modellen begynner å oppgradere seg selv og trekker seg irreversibelt unna mens alle andre spiser støv. Dette eksperimentet fliser bort på det bildet. Når ideene går fort tom, er ikke vinneren den smarteste spilleren, men den hvis løkke med «forslag — test — forkast» koster mindre og spinner raskere. Åpne modeller drevet av en god sele kjører flere forsøk per dollar - og det viser seg å ha mer betydning enn et annet referansepunkt.

Fangsten

For å være rettferdig: dette er en veldig smal oppgave. Et enkelt opplæringsmanus, én klar beregning, et entydig suksesskriterium – ekte vitenskap ser langt rotete ut. Det dukket heller ikke opp nye metoder, så dette handler fortsatt om å automatisere en forskers rutine fremfor å erstatte forskeren. Og resultatene avhenger sterkt av selve selen: den samme Kimi K3 uten agentlaget går merkbart dårligere.

FAQ

Hva er en agentsele?

Et lag rundt modellen: verktøy, et kodeutførelsesmiljø, minne om tidligere trinn, en oppgaveplanlegger. Modellen forblir den samme, men det blir lettere å jobbe - som at en person får et skikkelig skrivebord med riktig verktøy.

Kan vanlige brukere prøve Kimi K3?

Ja, vektene er åpne. Du kan chatte med den iNeuralSpace Chatog prøv arbeidsflyter i agentstilKode.

Så vil AI skrive vitenskapelige artikler på egen hånd snart?

Ikke så fort. Autonome agenter gjør det bra der det er en skarp beregning og rask tilbakemelding. Hypoteser, smak og å stille de riktige spørsmålene er fortsatt menneskelig territorium. Men infrastrukturen rundt modellene oppgraderes raskere enn noe annet akkurat nå - verdt å holde øye med.