← Все статьи

18 modelov AI vstúpilo do plne autonómnych výskumných pretekov – Kimi K3 s otvorenou hmotnosťou takmer chytil Clauda

18 modelov AI vstúpilo do plne autonómnych výskumných pretekov – Kimi K3 s otvorenou hmotnosťou takmer chytil Clauda

Prime Intellect práve spustil nezvyčajný experiment: 18 špičkových jazykových modelov – od Fable 5 a GPT-5.6 Sol až po Kimi K3 s otvorenou hmotnosťou – bolo uvoľnených na autonómnych výskumných behoch, do ktorých ľudia nikdy nevkročili. Koniec je hlasný: otvorený čínsky model zapojený do postroja lacného agenta sa dostal na dotykovú vzdialenosť od najdrahšej vlajkovej lode Anthropic. Tu je to, čo sa stalo a prečo je dôležité pre každého, kto sleduje pokrok AI.

Preteky: vycvičte model v čo najmenšom počte krokov

Úloha pochádza zo známeho projektu nanoGPT speedrun Andreja Karpathyho. Malý model so 124 miliónmi parametrov musí dosiahnuť stratu overovania 3,28 – pri použití čo najmenšieho počtu tréningových krokov. Recept na štartér sa tam dostane v 3 290 krokoch. Najlepšie, čo ľudia zvládli, je 2 600.

Agent dostane úložisko kódu, krátku knihu pravidiel a jeden cieľ. Potom je to už samo: ladenie optimalizátora, spustenie experimentov, zistenie skutočného zlepšenia z náhodného šumu, rozhodnutie, čo ďalej testovať. Hardvér: osem GPU H200, všetko je uzamknuté v offline karanténe, takže model nemôže vyhľadať pripravené odpovede. Celkovo bolo 153 plne autonómnych behov; najdlhšie trvalo osem dní.

Kto kde skončil

Anthropic's Fable 5 zašiel najďalej s 2 726 krokmi, čím uzavrel asi 82% medzery medzi základným receptom a ľudským rekordom. Vlajková loď Claude Opus 5 prekročila hranicu 2 920.

Potom prišlo prekvapenie. Kimi K3 s otvorenou váhou od Moonshot AI, ktorý beží cez multiagentový postroj Prime Agent Harness, sa zastavil na 2 930 krokoch. Desať krokov za vlajkovou loďou, ktorá stojí výrazne viac za token. GPT-5.6 Sol skončil na 3 042 – za otvoreným modelom.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Najzábavnejšia časť: nikto nevymyslel nič nové

Ani jeden pokus nepriniesol skutočne novú metódu. Všetko, čo skutočne fungovalo – šikovné normalizácie, rozvrhy rýchlosti učenia, priemerovanie hmotnosti – bolo popísané v novinách pred rokmi. Každý model sa zišiel na približne rovnakom vreci nápadov.

Rozdiel bol v prevedení. Silnejšie modely nepochovajú hypotézu po jednom zlom hode: zmenia náhodné semeno, zopakujú merania, prehodnotia staré myšlienky, keď sa podmienky zmenia. Opatrnejšie oddeľujú skutočný pokrok od hluku. A vytvárajú si vlastné nástroje: Kimi K3 napísal vlastné funkcie na porovnávanie kriviek strát a zostavil mini numerické laboratórium, ktoré overilo Newtonovu-Schulzovu metódu na obaloch na hračky predtým, ako ju presunie do skutočného tréningu.

Prečo to narúša skript "AI zlepšujúce AI"?

Klasický rekurzívny príbeh o sebazdokonaľovaní vyzerá takto: najchytrejší uzavretý model sa začne zlepšovať a nenávratne odíde, zatiaľ čo všetci ostatní jedia prach. Tento experiment tento obrázok odštiepi. Keď sa nápady rýchlo minú, víťazom nie je ten najchytrejší hráč, ale ten, ktorého slučka „navrhni – otestuj – zlikviduj“ stojí menej a točí sa rýchlejšie. Otvorené modely poháňané dobrým postrojom vykonajú viac pokusov za dolár – a to sa ukazuje byť dôležitejšie ako ďalší referenčný bod.

Úlovok

Aby som bol spravodlivý: toto je veľmi úzka úloha. Jediný tréningový scenár, jedna jasná metrika, jednoznačné kritérium úspechu – skutočná veda vyzerá oveľa chaoticky. Neobjavili sa ani žiadne nové metódy, takže stále ide skôr o automatizáciu rutiny výskumníka ako o nahradenie výskumníka. A výsledky do značnej miery závisia od samotného postroja: rovnaký Kimi K3 bez vrstvy činidla beží výrazne horšie.

FAQ

Čo je to postroj agenta?

Vrstva okolo modelu: nástroje, prostredie na spustenie kódu, pamäť predchádzajúcich krokov, plánovač úloh. Model zostáva rovnaký, ale práca sa stáva jednoduchšou – ako keď človek dostane poriadny stôl so správnymi nástrojmi.

Môžu bežní používatelia vyskúšať Kimi K3?

Áno, závažia sú otvorené. Môžete s ním chatovaťNeuralSpace Chata vyskúšajte pracovné postupy v štýle agentovkód.

Bude teda AI čoskoro písať vedecké práce sama?

Nie tak rýchlo. Autonómnym agentom sa darí tam, kde existuje jasná metrika a rýchla spätná väzba. Hypotézy, vkus a kladenie správnych otázok sú stále ľudským územím. Infraštruktúra okolo modelov sa však práve teraz modernizuje rýchlejšie ako čokoľvek iné – stojí za to sledovať.