18个顶尖模型同场自主科研竞速:开源的Kimi K3几乎追平Claude旗舰
Prime Intellect 做了一场少见的实验:把 18 个顶级语言模型——从 Fable 5、GPT-5.6 Sol 到开源的 Kimi K3——放进完全自主、人类全程不插手的科研竞速里。结局相当震撼:一个配上廉价智能体框架的中国开源模型,几乎贴上了 Anthropic 最昂贵的旗舰。下面讲讲发生了什么,以及为什么所有关注 AI 进展的人都该在意。
赛题:用最少的训练步数把模型练到位
任务来自 Andrej Karpathy 著名的 nanoGPT speedrun 项目。一个 1.24 亿参数的小模型要把验证损失(loss)降到 3.28,而且训练步数越少越好。基线配方需要 3290 步;人类的最好成绩是 2600 步。
智能体拿到代码仓库、一份简短规则和唯一目标,之后就全靠自己:改优化器、跑实验、分辨真实提升与随机噪声、决定下一步试什么。硬件是 8 张 H200,全部锁在断网的沙箱里,防止模型直接抄现成答案。总共跑了 153 次完全自主的实验,最长的一次超过八天。
成绩单
跑得最远的是 Anthropic 的 Fable 5:2726 步,吃掉了基线到人类纪录之间约 82% 的差距。旗舰 Claude Opus 5 以 2920 步冲线。
然后是意外。Moonshot AI 的开源模型 Kimi K3 通过多智能体框架 Prime Agent Harness 运行,停在 2930 步——只比按 token 计价贵得多的旗舰慢 10 步。而 GPT-5.6 Sol 只跑到 3042 步,落在了开源模型后面。

最有意思的一点:谁也没发明新东西
153 次实验没有一次提出真正的新方法。真正奏效的招数——各种归一化、学习率调度、权重平均——论文里早就有。所有模型想到的主意大同小异。
差距在执行。强模型不会因为一次失败就枪毙假设:换随机种子、重复测量、条件变了再回头重试旧思路,也更擅长区分真实进步和噪声。它们还会给自己造工具:Kimi K3 自己写比较 loss 曲线的函数,搭了个小型数值实验室,先在简单案例上验证 Newton–Schulz 方法,再搬进真正的训练。
为什么这动摇了「AI 改进 AI」的老剧本
关于递归自我改进的经典剧本是:最聪明的闭源模型开始自己升级自己,把所有人越甩越远。这个实验恰恰在松动这幅图景。当想法很快见底时,赢的不是最聪明的那个,而是「提出假设—验证—丢弃」这一圈转得更便宜、更快的那个。好框架带动的开源模型每美元能做更多次尝试——这比榜单上再多一分更重要。
别高兴太早
说句实话:这里只有一道非常窄的题。单个训练脚本、清晰的指标、明确的成功标准——真正的科学远没这么规整。也没有任何新方法诞生,所以这仍是自动化研究者的日常杂活,而不是取代研究者。而且结果高度依赖框架本身:同一块 Kimi K3,摘掉智能体层就明显跑不动。
常见问题
什么是智能体框架?
围绕模型的中间层:工具、代码执行环境、对既往步骤的记忆、任务调度器。模型本身没变,但干起活来更顺手——就像人得到了一张配齐工具的好桌子。
普通用户能体验 Kimi K3 吗?
可以,它的权重已经开放。你可以在 NeuralSpace 聊天里和它对话,也可以在代码板块尝试智能体式的工作流。
那 AI 很快就能自己写论文了?
没那么快。自主智能体擅长的仍是有清晰指标、反馈迅速的任务。提假设、有品味、问对问题,暂时还是人类的领地。不过眼下被升级最快的恰恰是模型周边的基础设施,这个方向值得盯住。