← Все статьи

Нейросеть Ataraxos впервые обыграла лучшего игрока в Stratego — и обучилась за тысячи долларов вместо миллионов

Парящая светлая стеклянная игровая доска с рядами гладких фигур, часть подсвечена бирюзовым и коралловым

Нейросеть Ataraxos, которую собрала команда исследователей из Университета Карнеги — Меллона, MIT, Нью-Йоркского и Стэнфордского университетов, впервые в истории обыграла лучшего игрока в Stratego: 15 побед, 1 поражение и 4 ничьи в 20 партиях против Пима Нимейера, самого титулованного мастера этой игры. Результат опубликован в Nature. Необычна здесь не сама победа, а её цена: на обучение ушли 16 видеокарт на неделю и ещё 4 на четыре дня, то есть несколько тысяч долларов, тогда как предыдущая попытка DeepMind требовала вычислительных ресурсов примерно на 3–4,5 миллиона долларов. История про Stratego — на самом деле история о том, как принимать решения, когда половина обстановки скрыта: ровно та же задача стоит в переговорах, на финансовых рынках и в военных учениях.

Что такое Stratego и почему он не поддавался

В Stratego у каждого игрока 40 фигур, обозначающих воинские звания — от маршала до шпиона, плюс бомбы и флаг. Соперник видит, где стоят фигуры, но не знает, что это за фигуры. Личность раскрывается только при столкновении: слабейшая фигура снимается с доски, а победитель становится известен. Побеждает тот, кто захватит флаг противника.

Именно скрытая информация делает Stratego тяжёлым для машин. В техасском холдеме у игрока всего две закрытые карты — это 1326 возможных комбинаций, и компьютер может перебрать их все. В Stratego 40 фигур могут стоять в любом порядке: это больше 10^33 расстановок. Добавьте длину партии — в шахматах она редко превышает 40 ходов, а в Stratego легко тянется 2000, — и получите задачу, где классический перебор не работает.

Есть и третья сложность — блеф. Иногда выгодно двинуть слабую фигуру так, будто это маршал, чтобы напугать соперника. Если блефовать слишком часто, угрозы перестают что-либо значить; если никогда — вас быстро раскусят. Это равновесие и оказалось камнем преткновения для прежних ИИ. Даже DeepNash от DeepMind, представленный в 2022 году, при огромном бюджете так и не смог надёжно обыгрывать сильнейших людей.

Две идеи, которые изменили расклад

Как и DeepNash, Ataraxos учился, играя сам с собой — всего 163 миллиона партий. Побеждавшие ходы подкреплялись и встречались чаще, проигрышные — реже. Но скрытая информация заставляет такие алгоритмы «ходить по кругу»: оценка позиции постоянно смещается. Команда справилась с этим, меняя стратегию неравномерно — крупными и смелыми шагами в начале обучения и мелкими, осторожными позже.

Главное же новшество — то, чего у DeepNash не было: размышление перед каждым ходом. У AlphaGo общую стратегию уточнял поиск по дереву вариантов, но в Stratego пространство поиска слишком велико, и было непонятно, сработает ли такой подход вообще. Решение — вторая нейросеть, модель убеждений (belief model). Она смотрит, как ходит соперник, и оценивает, какие фигуры могут стоять на закрытых клетках. Ataraxos больше не перебирает все расстановки — он выбирает правдоподобные, проигрывает в них варианты ходов и решает, исходя из результата.

Парящая светлая стеклянная игровая доска с рядами гладких фигур, часть подсвечена бирюзовым и коралловым

Спокойный и невозмутимый

Название Ataraxos происходит от древнегреческого слова, означающего спокойствие и невозмутимость. И это заметно по манере игры. Там, где человек при разгромном счёте идёт на риск, ИИ методично отыгрывает позицию. Машине не мешает знание секрета: человеку трудно принимать решения, игнорируя известную ему скрытую информацию, а алгоритму — легко. Поэтому Ataraxos сохраняет невозмутимый вид даже когда «блефует», и отыгрывается из позиций, где у него оставалось лишь около 2% вероятности победы.

Нимейер — четырёхкратный чемпион мира и более 600 недель первый в мировом рейтинге. За три недели он сыграл с ИИ 20 партий, получая по 100 долларов за каждую победу, и победил лишь один раз. В этом поражении исследователи не видят изъяна: хорошая игра в Stratego требует случайной расстановки фигур, поэтому удача всегда играет роль. На чемпионате мира 2025 года желающие сразиться с Ataraxos выступили ещё хуже — ИИ выиграл 38 партий из 40.

Цифры: 16 видеокарт против 1024 чипов

DeepNash учился два-три месяца на 1024 специализированных чипах Google — по оценке команды Ataraxos, это 3–4,5 миллиона долларов по ценам 2025 года. Ataraxos обошёлся 16 видеокартами на неделю плюс 4 видеокарты на четыре дня для обучения модели убеждений. Играл он примерно в 34 раза меньше партий, а в итоге играл заметно сильнее. Секрет — в собственном симуляторе, который прогоняет миллионы ходов в секунду на видеокарте.

Не только Stratego

Тот же подход сработал и в других играх со скрытой информацией. В Barrage Stratego — быстрой версии с восемью фигурами — ИИ обыграл трёх чемпионов мира. В кооперативной карточной Hanabi и в китайской карточной игре доу дичжу он вышел на уровень лучших ботов. Это уже не разовое решение одной игры, а общий шаблон для обучения с подкреплением и поиска при большом объёме скрытых данных.

Исследователи смотрят дальше настольных игр. У реальных задач — переговоров, рынков, военных сценариев — нет фиксированных правил и явного победителя, но команда напоминает, что любой анализ реальной ситуации начинается с упрощённой модели. Для отработки решений сильного соперника такой подход годится уже сейчас. Оговорка тоже честная: Ataraxos пока не умеет объяснять, почему он сделал тот или иной ход, и это следующая задача команды.

Что это значит на практике

Главный вывод прост: решает не размер бюджета, а эффективность метода. Ataraxos потратил вычислительных ресурсов на порядки меньше предшественника и при этом играл сильнее. В генеративном ИИ действует та же логика: в объёме побеждает не самая тяжёлая модель, а та, что дешевле и надёжнее под задачу. По данным нашего сервиса за последние 30 дней (окно 05.09–05.10.2026, боевая база NeuralSpace) самой востребованной моделью изображений была отнюдь не самая дорогая: на nano-banana-2 пришлось 2351 генерация при средней себестоимости около 0,053 доллара за картинку. У видео та же картина: лёгкая grok-image-to-video набрала 1648 задач по 0,15 доллара, тогда как тяжёлая seedance-2.5 — лишь 246 при средней цене 1,74 доллара. Всего за 30 дней платформа выполнила 12 689 генераций: 9907 изображений, 2334 видео и 448 музыкальных треков (обезличенный агрегат, server/seo/benchmarkData.json).

Частые вопросы

Что такое Ataraxos?

Нейросеть для игры Stratego, созданная командой из CMU, MIT, NYU и Стэнфорда. Она первой в истории обыграла лучшего человека-игрока и делает это при несопоставимо меньших вычислительных затратах, чем прежние попытки.

Чем это отличается от победы AlphaGo в го?

В го и шахматах вся позиция видна обоим игрокам. Stratego — игра со скрытой информацией: половина фигур соперника неизвестна. Поэтому здесь потребовались не только обучение с подкреплением, но и модель, оценивающая скрытые фигуры, плюс поиск по правдоподобным расстановкам.

Можно ли попробовать подобные модели?

Сам Ataraxos — исследовательский проект, открытого доступа к нему нет. Но поговорить с современными языковыми моделями можно в чате NeuralSpace, а собрать собственный проект с ИИ — в разделе «Код».