← 所有文章

Ataraxos 首次击败史上最强 Stratego 玩家——训练只花了几千美元,而非数百万

悬浮的浅色玻璃棋盘上排列着光滑棋子,部分棋子发出青绿与珊瑚色微光

由卡内基梅隆大学、MIT、纽约大学和斯坦福大学研究者打造的 AI「Ataraxos」,首次在历史上击败了最强 Stratego 玩家:在与史上最负盛名的选手皮姆·尼梅耶尔(Pim Niemeijer)的 20 局对弈中取得 15 胜 1 负 4 平。成果发表在 Nature 上。真正引人注目的不是胜利本身,而是它的成本:训练用了 16 块显卡跑一周,再加 4 块显卡跑四天,也就是几千美元;而此前 DeepMind 的尝试需要约 300 万至 450 万美元的算力。Stratego 这个故事,本质上是关于「当局面有一半是隐藏的」时如何决策——谈判、金融市场和军事推演面对的正是同一个问题。

Stratego 是什么,为什么它一直攻不下

Stratego 里每位玩家有 40 枚棋子,代表从元帅到间谍的军衔,另有炸弹和军旗。对手能看到你的棋子在哪,却不知道它们是什么。只有在碰撞时身份才会揭晓:较弱的一枚被移出棋盘,胜者身份公开。先夺下对方军旗者获胜。

正是隐藏信息让 Stratego 对机器格外困难。德州扑克里玩家只有两张暗牌——1326 种可能,计算机可以全部枚举。Stratego 的 40 枚棋子可以任意排列:超过 10^33 种布局。再加上对局长度——国际象棋很少超过 40 步,而 Stratego 轻松能下到 2000 步——就得到一个暴力搜索完全失效的问题。

第三重难度是诈唬。有时把一枚弱子当作元帅来移动,可以吓退对手。诈唬太多,威胁就失去意义;从不诈唬,又容易被看穿。正是这个平衡卡住了此前的 AI。即便是 DeepMind 2022 年推出的 DeepNash,凭巨额预算也始终无法稳定战胜顶尖人类。

改变局面的两个思路

和 DeepNash 一样,Ataraxos 通过自我对弈学习——总共 1.63 亿局。获胜的走法被强化、更频繁地出现,落败的走法则减少。但隐藏信息会让这类算法「绕圈」:局面估值不断漂移。团队的做法是让策略变化不均匀——训练早期迈出大胆的大步,后期则是谨慎的小步。

更关键的创新是 DeepNash 所没有的:每一步前的推演。AlphaGo 用搜索来精化总体策略,但 Stratego 的搜索空间太大,这种办法能否奏效一直是个未知数。答案是一个第二神经网络——「信念模型」(belief model)。它观察对手怎么走,估计暗格里可能是什么棋子。Ataraxos 不再遍历所有布局,而是采样若干合理布局,在其中推演候选走法,再根据结果做决定。

悬浮的浅色玻璃棋盘上排列着光滑棋子,部分棋子发出青绿与珊瑚色微光

冷静而从容

Ataraxos 的名字来自古希腊语,意为「冷静、不为所动」,这在其棋风中也能看出。当人类在大比分落后时选择孤注一掷,它会一步步有条不紊地把局面扳回来。掌握秘密并不会像干扰人一样干扰机器:人很难在无视已知隐藏信息的情况下做决定,机器却毫无负担。因此 Ataraxos 能面不改色地「诈唬」,并从胜率仅剩约 2% 的残局里翻盘。

尼梅耶尔是四届世界冠军,在世界第一的位置上待了超过 600 周。三周内他与 AI 下了 20 局,每赢一局得 100 美元,只赢下一局。研究者并不认为这盘失利是缺陷:Stratego 的高手对局要求随机布阵,运气始终占一席之地。在 2025 年 Stratego 世界锦标赛上,愿意挑战 Ataraxos 的选手表现更差——AI 在 40 局里赢了 38 局。

数字:16 块显卡对 1024 块芯片

DeepNash 在 1024 块 Google 专用芯片上训练了两到三个月——据 Ataraxos 团队估算,以 2025 年价格计约合 300 万至 450 万美元。而 Ataraxos 只需 16 块显卡跑一周,外加 4 块显卡跑四天来训练信念模型。它对弈的局数少了约 34 倍,最终却强得多。秘诀在于一个自研模拟器,能在显卡上以每秒数百万步的速度推演。

不只是 Stratego

同样的方法在其他隐藏信息博弈里也奏效。在只有八枚棋子的快速版 Barrage Stratego 中,AI 击败了三位世界冠军;在合作卡牌游戏 Hanabi 以及中国纸牌游戏斗地主中,它达到了顶级机器人的水平。这不再是对单一游戏的一次性解法,而是强化学习与搜索在大量隐藏信息下的一套通用设计范式。

研究者把目光投向棋盘之外。现实问题——谈判、市场、军事场景——没有固定规则,也没有明确的赢家,但团队提醒,任何对真实情境的分析都始于一个简化模型。要演练如何应对强劲对手,这套方法现在就能用。坦率的保留也同样存在:Ataraxos 目前还无法解释自己为何走出某一步,这是团队接下来的任务。

实际意味着什么

结论很简单:决定胜负的不是预算规模,而是方法的效率。Ataraxos 花的算力比前作少了几个数量级,棋力却更强。生成式 AI 也是同样的逻辑:论体量,赢的不是最重的模型,而是对任务而言更便宜、更可靠的那个。根据我们服务最近 30 天的数据(窗口 05.09–05.10.2026,NeuralSpace 生产库),需求最大的图像模型远非最贵的那个:nano-banana-2 承担了 2351 次生成,平均成本约每张 0.053 美元。视频也是如此:轻量的 grok-image-to-video 有 1648 个任务,每个 0.15 美元;而沉重的 seedance-2.5 只有 246 个,平均 1.74 美元。30 天里平台共完成 12,689 次生成:9907 张图、2334 条视频和 448 段音乐(匿名聚合数据,server/seo/benchmarkData.json)。

常见问题

Ataraxos 是什么?

一个为 Stratego 打造的神经网络,由 CMU、MIT、纽约大学和斯坦福的团队开发。它是历史上第一个击败最强人类玩家的系统,且算力开销远低于此前的尝试。

这和 AlphaGo 赢下围棋有什么不同?

围棋和国际象棋中双方都能看到完整局面。Stratego 是隐藏信息博弈:对手一半的棋子是未知的。因此它不仅需要强化学习,还需要一个估计隐藏棋子的模型,以及对合理布局的搜索。

我能体验类似的模型吗?

Ataraxos 本身是研究项目,没有公开访问入口。但你可以在 NeuralSpace 聊天里和现代语言模型对话,也可以在代码板块搭建自己的 AI 项目。