18 modelů umělé inteligence vstoupilo do plně autonomního výzkumného závodu – Kimi K3 s otevřenou váhou málem chytil Clauda
Prime Intellect právě provedl neobvyklý experiment: 18 špičkových jazykových modelů – od Fable 5 a GPT-5.6 Sol po otevřenou Kimi K3 – bylo uvolněno na autonomní výzkumné běhy, kam lidé nikdy nevstoupili. Konec je hlasitý: otevřený čínský model připojený k levnému agentu se dostal na dotek nejdražší vlajkové lodi Anthropic. Zde je to, co se stalo, a proč je důležité pro každého, kdo sleduje pokrok AI.
Závod: vycvičte model v co nejmenším počtu kroků
Úkol pochází ze známého projektu nanoGPT speedrun Andreje Karpathy. Malý model se 124 miliony parametrů musí dosáhnout ztráty při ověřování 3,28 – s použitím co nejmenšího počtu tréninkových kroků. Recept na startér se tam dostane ve 3 290 krocích. Nejlepších lidí, které zvládli, je 2 600.
Agent obdrží úložiště kódu, krátkou knihu pravidel a jeden cíl. Poté už je to samo: ladění optimalizátoru, spouštění experimentů, zjištění skutečného zlepšení z náhodného šumu, rozhodnutí, co testovat dále. Hardware: osm GPU H200, vše uzamčeno v offline karanténě, takže model nemůže vyhledat připravené odpovědi. Celkem bylo 153 plně autonomních běhů; nejdelší se protáhl za posledních osm dní.
Kdo kde skončil
Anthropic's Fable 5 došel nejdále s 2 726 kroky, čímž zacelil asi 82 % mezery mezi základním receptem a lidským rekordem. Vlajková loď Claude Opus 5 překročila hranici na 2 920.
Pak přišlo překvapení. Otevřená váha Kimi K3 z Moonshot AI, procházející multiagentním postrojem Prime Agent Harness, se zastavila na 2 930 krocích. Deset kroků za vlajkovou lodí, která stojí znatelně více za token. GPT-5.6 Sol skončil na 3 042 — za otevřeným modelem.

Nejzábavnější část: nikdo nevymyslel nic nového
Ani jeden běh nevytvořil skutečně novou metodu. Všechno, co skutečně fungovalo – chytré normalizace, plány rychlosti učení, průměrování hmotnosti – bylo před lety popsáno v novinách. Každý model se sblížil se zhruba stejným pytlem nápadů.
Rozdíl byl v provedení. Silnější modely nepohřbí hypotézu po jednom špatném hodu: změní náhodné semeno, opakují měření, přehodnocují staré myšlenky, jakmile se podmínky změní. Obezřetněji oddělují skutečný pokrok od hluku. A vytvářejí své vlastní nástroje: Kimi K3 napsal vlastní funkce pro porovnávání ztrátových křivek a sestavil mini numerickou laboratoř, která ověřovala Newton-Schulzovu metodu na pouzdrech na hračky, než ji přesunula do skutečného tréninku.
Proč to narušuje skript "AI vylepšování AI"?
Klasický rekurzivní příběh o sebezdokonalování vypadá takto: nejchytřejší uzavřený model se začne sám upgradovat a nenávratně odjede, zatímco všichni ostatní žerou prach. Tento experiment tento obrázek odštípne. Když nápady rychle dojdou, vítězem není nejchytřejší hráč, ale ten, jehož smyčka „navrhni – otestuj – vyhoď“ stojí méně a točí se rychleji. Otevřené modely poháněné dobrým svazkem vykonají více pokusů za dolar – a to se ukazuje být důležitější než další referenční bod.
Úlovek
Abychom byli spravedliví: toto je jeden velmi úzký úkol. Jediný tréninkový scénář, jedna jasná metrika, jednoznačné kritérium úspěchu – skutečná věda vypadá mnohem chaoticky. Neobjevily se ani žádné nové metody, takže jde stále o automatizaci rutiny výzkumníka, spíše než o nahrazení výzkumníka. A výsledky do značné míry závisí na samotném postroji: stejná Kimi K3 bez vrstvy agenta běží znatelně hůře.
FAQ
Co je to postroj agenta?
Vrstva kolem modelu: nástroje, prostředí pro spouštění kódu, paměť předchozích kroků, plánovač úloh. Model zůstává stejný, ale práce se stává snazší – jako když člověk získává pořádný stůl se správnými nástroji.
Mohou běžní uživatelé vyzkoušet Kimi K3?
Ano, závaží jsou otevřená. Můžete s ním chatovatChat v NeuralSpacea vyzkoušejte pracovní postupy ve stylu agentůKód.
Bude tedy AI brzy sama o sobě psát vědecké práce?
Ne tak rychle. Autonomní agenti si vedou dobře tam, kde existuje jasná metrika a rychlá zpětná vazba. Hypotézy, vkus a kladení správných otázek jsou stále lidským územím. Infrastruktura kolem modelů se ale právě teď upgraduje rychleji než cokoli jiného – stojí za to to sledovat.