← Все статьи

18 нейросетей отправили в автономную научную гонку. Открытая Kimi K3 почти догнала флагман Claude

Светящиеся лабораторные модули соединены потоками данных в тёмной арене автономных экспериментов

Лаборатория Prime Intellect провела необычный эксперимент: 18 топовых языковых моделей — от Fable 5 и GPT-5.6 Sol до открытой Kimi K3 — запустили в автономные научные «заезды», где человек не вмешивается вообще. Финал получился громким: открытая китайская модель с недорогой агентной обвязкой подобралась вплотную к самому дорогому флагману Anthropic. Разбираем, что там произошло и почему это важно всем, кто следит за развитием ИИ.

Суть заезда: оптимизируй обучение за минимум шагов

Задачу взяли из известного проекта nanoGPT Андрея Карпаты. Небольшую модель на 124 миллиона параметров нужно обучить до loss 3.28 — но за как можно меньшее число шагов тренировки. Стартовый рецепт даёт результат за 3290 шагов. Лучшее, чего добивались люди, — 2600.

Агенту выдают репозиторий с кодом, короткий свод правил и цель. Дальше он сам: правит оптимизатор, ставит эксперименты, отличает реальное улучшение от случайного шума и решает, что проверять следующим. Железо — восемь H200, всё заперто в песочнице без интернета, чтобы модель не подсмотрела готовый ответ. Всего прогнали 153 полностью автономных прогона, самый длинный тянулся больше восьми суток.

Кто сколько выбежал

Дальше всех продвинулась Fable 5 от Anthropic — 2726 шагов, она закрыла примерно 82% пути между базовым рецептом и человеческим рекордом. Флагманский Claude Opus 5 финишировал на отметке 2920.

А вот дальше случилась сенсация. Открытая Kimi K3 от Moonshot AI, работая через мультиагентную обвязку Prime Agent Harness, остановилась на 2930 шагах. Десять шагов разницы с флагманом, который по токенам стоит заметно дороже. GPT-5.6 Sol при этом выбежал только на 3042 — позади открытой модели.

Светящиеся лабораторные модули соединены потоками данных в тёмной арене автономных экспериментов

Самое занятное: никто не придумал ничего нового

Ни один из 153 прогонов не выдал принципиально нового метода. Всё, что реально сработало — хитрые нормализации, расписания скорости обучения, усреднение весов, — давно описано в статьях. Набор идей у всех моделей оказался примерно одинаковым.

Разница была в исполнении. Сильные модели не хоронят гипотезу после одной неудачной попытки: меняют random seed, повторяют замеры, возвращаются к старым идеям, когда меняются условия. Аккуратнее отделяют настоящий прогресс от шума. А ещё — сами строят себе инструменты: Kimi K3 написала собственные функции для сравнения кривых loss и собрала мини-лабораторию, где сначала проверила численный метод Newton–Schulz на простых случаях, и только потом перенесла его в настоящую тренировку.

Почему это бьёт по сценарию «ИИ улучшает ИИ»

Классическая страшилка про рекурсивное самоулучшение звучит так: самая умная закрытая модель начинает совершенствовать себя сама и уходит в неотвратимый отрыв, остальные остаются за бортом. Этот эксперимент такую картину подтачивает. Когда идеи кончаются быстро, побеждает не самый умный, а тот, у кого цикл «выдвинул гипотезу — проверил — выбросил» стоит дешевле и крутится быстрее. Открытые модели под управлением хорошей обвязки делают больше попыток на каждый доллар, и это оказывается важнее очередного пункта в таблице бенчмарков.

Где подвох

Честности ради: задача тут одна и очень узкая. Один тренировочный скрипт, понятная метрика, чёткий критерий успеха — настоящая наука выглядит куда менее предсказуемо. Новых методов не появилось, так что речь пока про автоматизацию рутины исследователя, а не про замену исследователя. Ну и результат сильно зависит от самой обвязки: та же Kimi K3 без агентной прослойки бежит заметно хуже.

Частые вопросы

Что такое агентная обвязка?

Прослойка вокруг модели: инструменты, среда выполнения кода, память о прошлых шагах, планировщик задач. Модель остаётся той же, но работать ей удобнее — как человеку хороший стол с правильными инструментами.

Kimi K3 доступна обычным пользователям?

Да, веса модели открыты. Поговорить с ней можно, например, в чате NeuralSpace, а агентные сценарии попробовать в разделе «Код».

Значит, ИИ скоро сам напишет научную статью?

Не так быстро. Автономные агенты уверенно справляются с тем, где есть чёткая метрика и быстрая обратная связь. Гипотезы, вкус и постановка вопросов — пока за людьми. Но инфраструктуру вокруг моделей сейчас прокачивают активнее всего, так что следить за направлением стоит.