← Kaikki artikkelit

18 tekoälymallia osallistui täysin autonomiseen tutkimuskilpailuun – avoimen painon Kimi K3 melkein sai Clauden kiinni

18 tekoälymallia osallistui täysin autonomiseen tutkimuskilpailuun – avoimen painon Kimi K3 melkein sai Clauden kiinni

Prime Intellect suoritti juuri epätavallisen kokeen: 18 huippukielimallia – Fable 5:stä ja GPT-5.6 Solista avoimeen Kimi K3:een – päästettiin irti itsenäisistä tutkimusajoista, joihin ihmiset eivät koskaan astuneet. Loppu on äänekäs: halpa agenttivaljaisiin kytketty avoin kiinalainen malli tuli kosketuksen etäisyydelle Anthropicin kalleimmasta lippulaivasta. Tässä on mitä tapahtui ja miksi se on tärkeää kaikille, jotka seuraavat tekoälyn edistymistä.

Kisa: harjoittele mallia mahdollisimman vähän

Tehtävä tulee Andrej Karpathyn tunnetusta nanoGPT speedrun -projektista. Pienen 124 miljoonan parametrin mallin on saavutettava validointihäviö 3,28 käyttämällä mahdollisimman vähän koulutusvaiheita. Aloitusresepti tulee perille 3 290 vaiheessa. Paras ihminen on hallinnut 2600.

Agentti saa koodivaraston, lyhyen sääntökirjan ja yhden maalin. Sen jälkeen se on yksinään: optimoijan säätäminen, kokeilujen suorittaminen, todellisen parannuksen kertominen satunnaisesta kohinasta, päättäminen, mitä testataan seuraavaksi. Laitteisto: kahdeksan H200 GPU:ta, kaikki lukittu offline-hiekkalaatikkoon, joten malli ei voi etsiä valmiita vastauksia. Yhteensä oli 153 täysin autonomista ajoa; pisin viimeiset kahdeksan päivää.

Kuka lopetti missä

Anthropic's Fable 5 meni pisimmälle 2 726 askeleella, mikä täytti noin 82 % erosta perusreseptin ja ihmisennätyksen välillä. Lippulaiva Claude Opus 5 ylitti rajan 2 920:ssa.

Sitten tuli yllätys. Avopainoinen Moonshot AI:n Kimi K3, joka kulkee usean agentin Prime Agent -valjaiden läpi, pysähtyi 2 930 askeleen. Kymmenen askelta lippulaivan takana, joka maksaa huomattavasti enemmän per merkki. GPT-5.6 Sol sijoittui 3 042:een – avoimen mallin jälkeen.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Hauskin osa: kukaan ei keksinyt mitään uutta

Yksikään ajo ei tuottanut aidosti uutta menetelmää. Kaikkea, mikä todella toimi – älykkäät normalisoinnit, oppimisnopeuden aikataulut, painon keskiarvon laskeminen – kuvattiin papereissa vuosia sitten. Jokainen malli yhtyi suunnilleen samoihin ideoihin.

Erona oli toteutus. Vahvemmat mallit eivät hauta hypoteesia yhden huonon heiton jälkeen: ne muuttavat satunnaista siementä, toistavat mittauksia, palaavat vanhoihin ideoihin olosuhteiden muuttuessa. Ne erottavat todellisen edistyksen melusta tarkemmin. Ja he rakentavat omat työkalunsa: Kimi K3 kirjoitti mukautettuja funktioita tappiokäyrien vertailuun ja kokosi mininumeerisen laboratorion, joka validoi Newton–Schulz-menetelmän lelukoteloissa ennen sen siirtämistä todelliseen harjoitteluun.

Miksi tämä horjuttaa "AI parantaa tekoälyä" -skriptiä

Klassinen rekursiivinen itsensä kehittämistarina menee näin: älykkäin suljettu malli alkaa päivittää itseään ja vetäytyy peruuttamattomasti pois, kun kaikki muut syövät pölyä. Tämä kokeilu katkaisee kuvan. Kun ideat loppuvat nopeasti, voittaja ei ole älykkäin pelaaja, vaan se, jonka "ehdota - testaa - hylkää" -silmukka maksaa vähemmän ja pyörii nopeammin. Avoimet mallit, joissa on hyvät valjaat, tekevät enemmän yrityksiä dollaria kohden – ja sillä on enemmän merkitystä kuin toisella vertailupisteellä.

saalis

Ollakseni rehellinen: tämä on hyvin kapea tehtävä. Yksi koulutusohjelma, yksi selkeä mittari, yksiselitteinen menestyskriteeri – todellinen tiede näyttää paljon sotkuisemmalta. Uusia menetelmiä ei myöskään syntynyt, joten kyse on edelleen tutkijan rutiinin automatisoinnista eikä tutkijan korvaamisesta. Ja tulokset riippuvat vahvasti itse valjaista: sama Kimi K3 ilman agenttikerrosta toimii huomattavasti huonommin.

FAQ

Mikä on agenttivaljaat?

Kerros mallin ympärillä: työkalut, koodin suoritusympäristö, aiempien vaiheiden muisti, tehtävien ajoitus. Malli pysyy samana, mutta työskentely helpottuu - kuin henkilö hankkisi oikean työpöydän oikeilla työkaluilla.

Voivatko tavalliset käyttäjät kokeilla Kimi K3:a?

Kyllä, painot ovat auki. Voit keskustella sen kanssaNeuralSpace Chatja kokeile agenttityyppisiä työnkulkujaKoodi.

Joten kirjoittaako tekoäly pian yksin tieteellisiä artikkeleita?

Ei niin nopeasti. Autonomiset agentit pärjäävät hyvin, jos mittarit ovat tarkat ja palaute on nopeaa. Hypoteesit, maku ja oikeiden kysymysten esittäminen ovat edelleen ihmisten aluetta. Mutta mallien ympärillä olevaa infrastruktuuria päivitetään nopeammin kuin mitään muuta tällä hetkellä – kannattaa pitää silmällä.