← Svi članci

18 AI modela ušlo je u potpuno autonomnu istraživačku utrku — otvoreni Kimi K3 zamalo je uhvatio Claudea

18 AI modela ušlo je u potpuno autonomnu istraživačku utrku — otvoreni Kimi K3 zamalo je uhvatio Claudea

Prime Intellect je upravo proveo neobičan eksperiment: 18 vrhunskih jezičnih modela — od Fable 5 i GPT-5.6 Sol do otvorenog Kimi K3 — pušteno je na autonomna istraživanja u koja ljudi nikada nisu ušli. Kraj je glasan: otvoreni kineski model povezan s jeftinim agentskim pojasom došao je nadomak najskupljeg vodećeg broda Anthropica. Evo što se dogodilo i zašto je to važno za svakoga tko prati napredak umjetne inteligencije.

Utrka: obučite model u što je moguće manje koraka

Zadatak dolazi iz poznatog nanoGPT speedrun projekta Andreja Karpathyja. Mali model od 124 milijuna parametara mora postići gubitak valjanosti od 3,28 — koristeći što je moguće manje koraka obuke. Početni recept stiže u 3290 koraka. Najbolje što su ljudi uspjeli je 2600.

Agent dobiva repozitorij kodova, kratki pravilnik i jedan cilj. Nakon toga je sam: ugađanje optimizatora, izvođenje eksperimenata, izdvajanje stvarnog poboljšanja od nasumičnog šuma, odlučivanje što sljedeće testirati. Hardver: osam H200 GPU-ova, sve je zaključano unutar offline sandboxa tako da model ne može tražiti gotove odgovore. Ukupno je bilo 153 potpuno autonomne vožnje; najduži se protegao proteklih osam dana.

Tko je gdje završio

Anthropicova Fable 5 otišla je najdalje s 2726 koraka, zatvorivši oko 82% jaza između osnovnog recepta i ljudskog rekorda. Glavni Claude Opus 5 prešao je granicu na 2920.

Onda je uslijedilo iznenađenje. Kimi K3 s otvorenom težinom iz Moonshot AI-ja, trčeći kroz višeagentni Prime Agent Harness, zaustavio se na 2930 koraka. Deset koraka iza vodećeg modela koji košta osjetno više po tokenu. GPT-5.6 Sol završio je na 3042 — iza otvorenog modela.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Najsmješnije: nitko nije izmislio ništa novo

Niti jedno ispitivanje nije proizvelo istinski novu metodu. Sve što je zapravo funkcioniralo - pametne normalizacije, rasporedi brzine učenja, usrednjavanje težine - opisano je u dokumentima prije mnogo godina. Svaki se model okupio na otprilike istoj vreći ideja.

Razlika je bila u izvršenju. Jači modeli ne zakopavaju hipotezu nakon jednog lošeg bacanja: oni mijenjaju nasumično sjeme, ponavljaju mjerenja, preispituju stare ideje kada se uvjeti promijene. Pažljivije odvajaju pravi napredak od buke. I oni izrađuju vlastite alate: Kimi K3 napisao je prilagođene funkcije za usporedbu krivulja gubitaka i sastavio mini numerički laboratorij, potvrđujući Newton–Schulzovu metodu na kutijama igračaka prije nego što je premjestio u stvarnu obuku.

Zašto ovo narušava scenarij "AI poboljšava AI".

Klasična rekurzivna priča o samopoboljšanju ide ovako: najpametniji zatvoreni model počinje se nadograđivati ​​i nepovratno se povlači dok svi ostali jedu prašinu. Ovaj eksperiment uklanja tu sliku. Kad brzo ponestane ideja, pobjednik nije najpametniji igrač, već onaj čija petlja "predloži — testiraj — odbaci" košta manje i brže se vrti. Otvoreni modeli vođeni dobrom opremom imaju više pokušaja po dolaru — a to se pokazalo važnijim od druge referentne točke.

Kvaka

Da budemo pošteni: ovo je jedan vrlo uzak zadatak. Jedna skripta za obuku, jedna jasna metrika, nedvosmislen kriterij uspjeha - prava znanost izgleda mnogo neurednije. Nisu se pojavile niti nove metode, tako da se još uvijek radi o automatizaciji istraživačeve rutine, a ne o zamjeni istraživača. A rezultati uvelike ovise o samom pojasu: isti Kimi K3 bez sloja sredstva radi osjetno lošije.

FAQ

Što je agentski pojas?

Sloj oko modela: alati, okruženje za izvođenje koda, memorija prethodnih koraka, planer zadataka. Model ostaje isti, ali rad postaje lakši — kao da osoba dobije pravi stol s odgovarajućim alatima.

Mogu li obični korisnici isprobati Kimi K3?

Da, utezi su otvoreni. Možete razgovarati s njim uNeuralSpace Chati isprobajte tijekove rada u stilu agentaKodirati.

Hoće li umjetna inteligencija uskoro sama pisati znanstvene radove?

Ne tako brzo. Autonomni agenti rade dobro tamo gdje postoji jasna metrika i brza povratna informacija. Hipoteze, ukus i postavljanje pravih pitanja još uvijek su ljudski teritorij. Ali infrastruktura oko modela trenutno se nadograđuje brže nego bilo što drugo - vrijedi je paziti.