开源 9B 模型 ZDTaichu5.0-9B 拿下 9 项空间测试中的 8 项,通用能力没掉队
中国团队把 ZDTaichu5.0-9B 的权重开源了:90 亿参数,上下文最长 128K,输入支持文本、图片和视频。重点不在体积。在九项国际空间推理测试里,它有八项领先所有 10B 以下的模型,包括 Qwen3.5-9B 和 STEP3-VL-10B;MindCube-tiny 上拿到 78.27,而 Gemini 3 Pro 是 70.87,Grok 4 是 63.56。而且没有走常见的那条老路——文字识别、数学和代码依然留在同级别的第一梯队。
为什么「看懂空间」是另一码事
多模态模型描述图片早就还行:画面里有什么、谁站在哪、招牌上写了什么。但你让它把房间里的东西挪一挪,问题就来了。杯子的把手到底在哪一侧?转身面向沙发之后,柜子在你哪边?盘子右边那块地方空着吗?
这是另一类任务。要做的不是「认出物体」,而是在脑子里搭出三维场景、换算坐标系,再判断手到底能不能伸过去。机器人卡住的正是这里,而不是识别。
还有第二个坑:模型通常只往一个方向练。空间数据喂多了,数学和 OCR 就掉。ZDTaichu5.0-9B 打的就是「两把椅子一起坐」。
实际能干什么
演示里有三道日常题,对机器人来说一点都不日常。
第一道:在堆满杂物的桌面上「从左往右找出第二个银色盒子」。模型要同时抓住「银色」这个属性、「盒子」这个类别和「左起第二个」这个顺序,最后给出归一化坐标 (237, 226)——正好落在目标区域内。
第二道:同一个房间的三张视角图。模型要想象自己走到绿色窗帘旁、转身面向蓝色沙发,再说出红色柜子相对自己的方位。答案是「右前方」,正确。这已经不是识别,而是换参考系。
第三道:在最右侧杯子的杯柄方向找一块空位。先判断杯柄朝哪,再看旁边有没有被占。同样命中。

再往后是更长的流程:机械臂把美工刀收回抽屉、双臂把试管递进架子、机械手从料架取下工件放到台面。每一步模型记住的不只是当前画面,还有上一步动作之后环境变成了什么样。
数字
对比对象是开源的 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B,以及闭源的 Gemini 3 Pro、Grok 4、GPT-5.2。
空间类:MindCube-tiny 78.27(Gemini 3 Pro 70.87,Grok 4 63.56,gemma4-8B-E4B 48.85)。ViewSpatial 62.50,Qwen3.5-9B 是 48.20。MMSI-Bench 47.20 对 38.70。VSI-Bench 59.69。SparBench 51.82。RoboSpatial 56.00。ERQA 48.00。3DSRBench 60.96。唯一在同级别里输掉的是 CV-Bench:86.82 对 Qwen3.5-9B 的 87.19。所谓「八项」就是这么来的。
通用视觉:AI2D 91.48(Gemini 3 Pro 94.10,GPT-5.2 92.20),MathVista Mini 84.50,WeMath 75.90,OCRBench 85.50,MMStar 76.80。
智能体与文本:TAU2-Bench 87.70,Claw-Eval 71.40,IFEval 93.70,LiveCodeBench v6 73.40,AIME 2025 86.70。
但看看这个落差。MMLU-Pro 上它明显落后(77.20 对 Gemini 3 Pro 的 89.80),OCRBench 也是(85.50 对 90.40)。这不是全能冠军,而是一个空间能力极强、通用水平不错但并非最好的模型。
怎么做到的
两块:数据和推理。
数据侧,团队描述了一条三段式流水线。先做预训练,素材是开源图文对、网页文档、多帧视频和仿真三维场景,中间做去重和低质过滤。然后做监督微调,覆盖指令、真实问答、空间案例和工具调用轨迹。最后挑出信息量最高的样本,用强化学习继续打磨,奖励是自动算的:答案对不对、坐标有没有命中、格式合不合规。
有个细节挺有意思:涉及物理动作的样本,流水线会检查图片、问题、物体关系和动作约束是否自洽。如果画面里抽屉是关着的,模型就不该被训练成说「把东西放进去」。
第二块是自适应循环推理。一次标准前向之后,模型看当前 token 的分布熵。熵低就直接输出;熵高就再跑一遍中间层块,在潜空间里细化隐状态,把算力倾斜给难判断的 token。停止由两个信号同时决定——分布之间的 KL 散度和隐状态残差;再从整条轨迹里挑风险最低的表征,必要时回滚。
这个思路不算独创:类似「难题多算、简单题少算」的做法最近也出现在 GPT-6 Astra 上。但在同尺寸的开源模型里,这大概是第一次落地。
别高兴太早
第一,所有数字都来自团队自己的发布博客。目前没有第三方复现,而空间推理基准本身很年轻,也容易被过拟合。
第二,9B 就是 9B。在知识和通用推理上它老老实实输给旗舰,在真实机器人系统里它负责的是上层规划,而不是替掉整套控制。
第三,演示是挑出来的成功案例。十次里有几次机械臂真能把刀放回抽屉,发布里看不出来。
怎么用
权重是开放的:GitHub 仓库、Hugging Face 和 ModelScope 上的模型卡,还有一个单独的基准页面。团队说可以拿自己的数据继续微调——车间录像、实验记录、仿真素材都行。
如果只是想看看这类模型怎么回答图片问题,可以在 NeuralSpace 聊天里试;视频相关的任务在视频板块,生成图片在图片板块。
来源:量子位(QbitAI)以及模型的官方发布博客。