18 modeli sztucznej inteligencji wzięło udział w całkowicie autonomicznym wyścigu badawczym — Kimi K3 o wadze otwartej prawie złapał Claude'a
Firma Prime Intellect właśnie przeprowadziła niezwykły eksperyment: 18 najlepszych modeli językowych — od Fable 5 i GPT-5.6 Sol po Kimi K3 o otwartej wadze — zostało wypuszczonych na autonomiczne badania, w które nigdy nie wtrącił się człowiek. Zakończenie jest głośne: otwarty chiński model podłączony do taniej uprzęży agenta znalazł się na wyciągnięcie ręki od najdroższego statku flagowego Anthropic. Oto, co się wydarzyło i dlaczego jest to ważne dla każdego, kto śledzi postęp AI.
Wyścig: wytrenuj model w jak najmniejszej liczbie kroków
Zadanie pochodzi ze znanego projektu speedrun nanoGPT Andreja Karpathy'ego. Mały model zawierający 124 miliony parametrów musi osiągnąć utratę walidacji wynoszącą 3,28 — przy użyciu jak najmniejszej liczby kroków szkoleniowych. Przepis na starter można uzyskać w 3290 krokach. Najlepsze, co udało się ludziom, to 2600.
Agent otrzymuje repozytorium kodów, krótki regulamin i jeden cel. Potem wszystko już samo: poprawianie optymalizatora, przeprowadzanie eksperymentów, wyciąganie wniosków z rzeczywistej poprawy na podstawie przypadkowych szumów, decydowanie, co dalej testować. Sprzęt: osiem procesorów graficznych H200, wszystko zamknięte w piaskownicy offline, więc model nie może wyszukiwać gotowych odpowiedzi. Łącznie odbyły się 153 w pełni autonomiczne przejazdy; najdłuższy trwał osiem dni.
Kto gdzie skończył
Anthropic’s Fable 5 osiągnął najdalej 2726 kroków, zamykając około 82% luki między bazowym przepisem a rekordem człowieka. Flagowy Claude Opus 5 przekroczył granicę z wynikiem 2920.
Potem przyszła niespodzianka. Kimi K3 z ciężarem otwartym od Moonshot AI biegnąca przez wieloagentową uprząż Prime Agent Harness zatrzymała się na 2930 krokach. Dziesięć kroków za flagowcem, który kosztuje zauważalnie więcej w przeliczeniu na token. GPT-5.6 Sol osiągnął wynik 3042 – za modelem otwartym.

Najzabawniejsza część: nikt nie wymyślił niczego nowego
W żadnym przypadku nie opracowano naprawdę nowatorskiej metody. Wszystko, co faktycznie działało – sprytne normalizacje, harmonogramy tempa uczenia się, uśrednianie wagi – zostało opisane w artykułach wiele lat temu. Każdy model opierał się na mniej więcej tym samym zestawie pomysłów.
Różnica polegała na wykonaniu. Silniejsze modele nie pogrzebią hipotezy po jednym złym rzucie: zmieniają losowe ziarno, powtarzają pomiary, wracają do starych pomysłów, gdy zmienią się warunki. Staranniej oddzielają prawdziwy postęp od hałasu. Budują także własne narzędzia: Kimi K3 napisała niestandardowe funkcje do porównywania krzywych strat i zbudowała mini laboratorium numeryczne, weryfikując metodę Newtona-Schulza na pudełkach z zabawkami przed przeniesieniem jej do prawdziwego szkolenia.
Dlaczego to szkodzi skryptowi „AI ulepszająca AI”.
Klasyczna historia rekurencyjnego samodoskonalenia wygląda następująco: najmądrzejszy model zamknięty zaczyna się unowocześniać i nieodwracalnie się oddala, podczas gdy wszyscy inni zjadają kurz. Ten eksperyment psuje ten obraz. Kiedy pomysły szybko się kończą, zwycięzcą nie jest najmądrzejszy gracz, ale ten, którego pętla „zaproponuj – przetestuj – odrzuć” kosztuje mniej i kręci się szybciej. Otwarte modele napędzane dobrą uprzężą wykonują więcej prób na dolara – a to okazuje się mieć większe znaczenie niż kolejny punkt odniesienia.
Haczyk
Aby być uczciwym: jest to bardzo wąskie zadanie. Pojedynczy scenariusz szkoleniowy, jeden jasny miernik, jednoznaczne kryterium sukcesu – prawdziwa nauka wygląda o wiele bardziej chaotycznie. Nie pojawiły się też żadne nowe metody, więc nadal chodzi o automatyzację rutyny badacza, a nie o jego zastępowanie. Wyniki zależą w dużej mierze od samej uprzęży: ten sam Kimi K3 bez warstwy środka działa zauważalnie gorzej.
Często zadawane pytania
Co to jest uprząż agenta?
Warstwa wokół modelu: narzędzia, środowisko wykonania kodu, pamięć poprzednich kroków, harmonogram zadań. Model pozostaje ten sam, ale praca staje się łatwiejsza — jak osoba, która dostaje porządne biurko z odpowiednimi narzędziami.
Czy zwykli użytkownicy mogą wypróbować Kimi K3?
Tak, ciężary są otwarte. Możesz z nim porozmawiaćCzat NeuralSpacei wypróbuj przepływy pracy w stylu agenta wKod.
Czy zatem sztuczna inteligencja wkrótce sama napisze artykuły naukowe?
Nie tak szybko. Agenci autonomiczni radzą sobie dobrze tam, gdzie istnieją jasne wskaźniki i szybka informacja zwrotna. Hipotezy, gust i zadawanie właściwych pytań to wciąż domena człowieka. Ale infrastruktura wokół modeli jest obecnie unowocześniana szybciej niż cokolwiek innego — warto na to zwracać uwagę.