← Összes cikk

18 mesterséges intelligencia modell szállt be egy teljesen autonóm kutatási versenybe – a nyitott súlyú Kimi K3 majdnem elkapta Claude-ot

18 mesterséges intelligencia modell szállt be egy teljesen autonóm kutatási versenybe – a nyitott súlyú Kimi K3 majdnem elkapta Claude-ot

A Prime Intellect éppen most futtatott le egy szokatlan kísérletet: 18 legjobb nyelvi modellt – a Fable 5-től és a GPT-5.6 Sol-tól a nyitott súlyú Kimi K3-ig – szabadon engedtek olyan autonóm kutatások során, ahol az ember soha nem lépett be. A vége hangos: egy nyílt kínai modell, amely egy olcsó ügynökköteghez volt csatlakoztatva, érinthető távolságra került az Anthropic legdrágább zászlóshajójától. Íme, mi történt, és miért számít ez azoknak, akik nyomon követik az AI előrehaladását.

A verseny: képezzen modellt a lehető legkevesebb lépésben

A feladat Andrej Karpathy jól ismert nanoGPT speedrun projektjéből származik. Egy kis, 124 millió paraméteres modellnek 3,28-as validációs veszteséget kell elérnie – a lehető legkevesebb képzési lépés felhasználásával. A kezdőrecept 3290 lépésben kerül oda. A legjobb ember, akivel sikerült, 2600.

Az ügynök kap egy kódtárat, egy rövid szabálykönyvet és egy célt. Utána már önmagában: az optimalizáló finomhangolása, kísérletek futtatása, valódi javulás megállapítása a véletlenszerű zajból, döntés, hogy mit teszteljünk tovább. Hardver: nyolc H200 GPU, minden egy offline sandboxba zárva, így a modell nem tud kész válaszokat keresni. Összesen 153 teljesen autonóm futás volt; a leghosszabb nyolc napon át húzódott.

Ki hol végzett

Az Anthropic's Fable 5 jutott a legtávolabbra 2726 lépéssel, amivel az alaprecept és az emberi rekord közötti különbség mintegy 82%-át sikerült bezárni. A zászlóshajó Claude Opus 5 2920-nál lépte át a határt.

Aztán jött a meglepetés. A Moonshot AI nyitott súlyú Kimi K3-ja, amely a többügynökből álló Prime Agent Harness-en fut, 2930 lépésnél állt meg. Tíz lépéssel lemaradva egy zászlóshajó mögött, amely tokenenként észrevehetően többe kerül. A GPT-5.6 Sol 3042 helyen végzett – a nyitott modell mögött.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

A legviccesebb rész: senki sem talált ki semmi újat

Egyetlen futam sem hozott létre igazán újszerű módszert. Mindent, ami ténylegesen működött – ügyes normalizálásokat, tanulási ütemterveket, súlyátlagolást – évekkel ezelőtt leírtak az újságok. Minden modell nagyjából ugyanazon ötletcsomagon konvergált.

A különbség a végrehajtás volt. Az erősebb modellek nem temetik el a hipotézist egy rossz dobás után: megváltoztatják a véletlenszerű magot, megismétlik a méréseket, újragondolják a régi elképzeléseket, ha a körülmények megváltoznak. Óvatosabban választják el a valódi haladást a zajtól. És megépítik a saját eszközeiket: Kimi K3 egyedi függvényeket írt a veszteséggörbék összehasonlításához, és összeállított egy mini numerikus labort, amely a Newton–Schulz módszert játéktokokon érvényesítette, mielőtt valódi edzésbe ültetné.

Miért rontja ez az „AI javító AI” szkriptet

A klasszikus, rekurzív önfejlesztési történet így hangzik: a legokosabb zárt modell elkezdi magát frissíteni, és visszafordíthatatlanul elhúzódik, miközben mindenki port eszik. Ez a kísérlet eltörli ezt a képet. Ha az ötletek gyorsan elfogynak, nem a legokosabb játékos a győztes, hanem az, akinek a „javaslom – tesztelje – dobja el” ciklusa kevesebbe kerül és gyorsabban pörög. A jó hevederrel hajtott nyitott modellek dolláronként több próbálkozást hajtanak végre – és kiderül, hogy ez többet számít, mint egy másik referenciapont.

A fogás

Az igazság kedvéért: ez egy nagyon szűk feladat. Egyetlen képzési forgatókönyv, egyetlen egyértelmű mérőszám, egyértelmű sikerkritérium – a valódi tudomány sokkal zavarosabbnak tűnik. Új módszerek sem jelentek meg, tehát itt továbbra is a kutatói rutin automatizálásáról van szó, nem pedig a kutató leváltásáról. Az eredmények pedig erősen magától a hevedertől függenek: ugyanaz a Kimi K3, az ügynökréteg nélkül, észrevehetően rosszabbul működik.

GYIK

Mi az az ügynököv?

Egy réteg a modell körül: eszközök, kódvégrehajtási környezet, korábbi lépések memóriája, feladatütemező. A modell változatlan marad, de a munka könnyebbé válik – mintha valaki megfelelő íróasztalt kapna megfelelő szerszámokkal.

A rendszeres felhasználók kipróbálhatják a Kimi K3-at?

Igen, a súlyok nyitva vannak. Beszélgethetsz veleNeuralSpace Chatés próbálja ki az ügynök-stílusú munkafolyamatokatKód.

Tehát az AI hamarosan önállóan ír tudományos dolgozatokat?

Nem olyan gyorsan. Az autonóm ügynökök jól teljesítenek ott, ahol éles mérőszám és gyors visszajelzés van. A hipotézisek, az ízlés és a helyes kérdések feltevése még mindig emberi terület. A modellek körüli infrastruktúra azonban jelenleg minden másnál gyorsabban frissül – érdemes odafigyelni rá.