← Все статьи

18 modele AI au intrat într-o cursă de cercetare complet autonomă – Kimi K3 cu greutate deschisă aproape l-a prins pe Claude

18 modele AI au intrat într-o cursă de cercetare complet autonomă – Kimi K3 cu greutate deschisă aproape l-a prins pe Claude

Prime Intellect tocmai a desfășurat un experiment neobișnuit: 18 modele de limbaj de top – de la Fable 5 și GPT-5.6 Sol până la Kimi K3 cu greutate deschisă – au fost eliberate în curse de cercetare autonome în care oamenii nu au intervenit niciodată. Sfârșitul este zgomotos: un model chinezesc deschis conectat la un cablaj de agent ieftin a ajuns la o distanță de cel mai scump flagship al Anthropic. Iată ce s-a întâmplat și de ce contează pentru oricine urmărește progresul AI.

Cursa: antrenează un model în cât mai puțini pași

Sarcina provine din binecunoscutul proiect speedrun nanoGPT al lui Andrej Karpathy. Un model mic de 124 de milioane de parametri trebuie să atingă o pierdere de validare de 3,28 - folosind cât mai puțini pași de antrenament. Rețeta de pornire ajunge acolo în 3.290 de pași. Cei mai buni oameni pe care i-au reușit sunt 2.600.

Agentul primește un depozit de coduri, un scurt regulament și un obiectiv. După aceea, este de la sine: ajustarea optimizatorului, desfășurarea experimentelor, identificarea unei îmbunătățiri reale din zgomotul aleatoriu, deciderea ce să testeze în continuare. Hardware: opt GPU-uri H200, totul blocat într-un sandbox offline, astfel încât modelul să nu poată căuta răspunsuri gata. În total au fost 153 de curse complet autonome; cel mai lung s-a întins peste opt zile.

Cine a terminat unde

Anthropic's Fable 5 a mers cel mai departe cu 2.726 de pași, reducând aproximativ 82% din decalajul dintre rețeta de bază și înregistrarea umană. Nava amiral Claude Opus 5 a trecut linia la 2.920.

Apoi a venit surpriza. Kimi K3 cu greutate deschisă de la Moonshot AI, care rulează prin Harnessul agentului principal multi-agent, sa oprit la 2.930 de pași. Zece pași în spatele unui flagship care costă considerabil mai mult pe jeton. GPT-5.6 Sol a terminat la 3.042 — în spatele modelului deschis.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Partea cea mai amuzantă: nimeni nu a inventat nimic nou

Nici o singură rulare nu a produs o metodă cu adevărat nouă. Tot ceea ce a funcționat de fapt - normalizări inteligente, programe ale ratei de învățare, mediere a greutății - a fost descris în lucrări cu ani în urmă. Fiecare model a convergit pe aproximativ același sac de idei.

Diferența a fost execuția. Modelele mai puternice nu îngroapă o ipoteză după o singură rulare proastă: schimbă sămânța aleatoare, repetă măsurătorile, revin ideilor vechi odată ce condițiile se schimbă. Ele separă cu mai multă atenție progresul real de zgomot. Și își construiesc propriile instrumente: Kimi K3 a scris funcții personalizate pentru compararea curbelor de pierdere și a asamblat un mini laborator numeric, validând metoda Newton-Schulz pe cutii de jucării înainte de a o muta în antrenament real.

De ce acest lucru afectează scriptul „AI îmbunătățind AI”.

Povestea clasică recursivă de auto-îmbunătățire arată așa: cel mai inteligent model închis începe să se modernizeze și se retrage ireversibil în timp ce toți ceilalți mănâncă praf. Acest experiment elimină acea imagine. Când ideile se epuizează repede, câștigătorul nu este cel mai deștept jucător, ci cel a cărui buclă de „propune – testează – aruncă” costă mai puțin și se învârte mai repede. Modelele deschise conduse de un ham bun execută mai multe încercări pe dolar - și asta se dovedește a conta mai mult decât un alt punct de referință.

Captura

Pentru a fi corect: aceasta este o sarcină foarte restrânsă. Un singur scenariu de antrenament, o măsurătoare clară, un criteriu de succes fără ambiguități – știința reală pare mult mai dezordonată. Nicio metodă nouă nu a apărut, așa că este vorba în continuare de automatizarea rutinei unui cercetător, mai degrabă decât de înlocuirea cercetătorului. Iar rezultatele depind în mare măsură de ham în sine: același Kimi K3 fără stratul de agent funcționează vizibil mai rău.

FAQ

Ce este un ham de agent?

Un strat în jurul modelului: instrumente, un mediu de execuție a codului, memorie a pașilor anteriori, un planificator de sarcini. Modelul rămâne același, dar lucrul devine mai ușor - ca și cum o persoană obține un birou adecvat cu instrumente adecvate.

Utilizatorii obișnuiți pot încerca Kimi K3?

Da, greutățile sunt deschise. Puteți discuta cu elNeuralSpace Chatși încercați fluxuri de lucru în stil agent înCod.

Deci AI va scrie lucrări științifice pe cont propriu în curând?

Nu atât de repede. Agenții autonomi se descurcă bine acolo unde există o metrică clară și feedback rapid. Ipotezele, gustul și adresarea întrebărilor potrivite sunt încă teritoriu uman. Dar infrastructura din jurul modelelor este actualizată mai rapid decât orice altceva în acest moment - merită să fii atent.