← 所有文章

DeepSeek 在便宜的 PCIe 显卡上提速 6.87 倍——只靠软件

服务器机房:一排暗色显卡与一排亮蓝色显卡,中间是流动的发光粒子

中国算力运营商是石科技(METASTONE)公布了其推理引擎 Meta-Infer 的结果。在一台只装八张 PCIe 显卡的整机上——没有显卡之间的高速 NVLink,硬件也便宜得多——DeepSeek-V4.1-Flash 的输入吞吐从每秒 1932 个 token 提升到 13274 个。这是 6.87 倍,而且全部来自软件:模型权重和结构都没有动。同样的做法在 DeepSeek-V4-Flash 上带来 1.55 倍,在 GLM 5.3 上带来 1.92 倍,在 MiniMax H3 的视频生成上最高达到 5.33 倍。

问题到底出在哪

大模型对算力的需求持续攀升,而顶级加速卡又贵又缺。于是很多人买更简单的卡:这类卡往往没有 NVLink 这条显卡间高速通道,也不在主流开源框架的官方验证名单里。

表面上看没什么:模型能加载,服务能起来。但底层框架会悄悄退回慢速的通用路径。一部分算子退化为通用但低效的实现,卡间通信参数照搬 NVLink,显存和并行配置照搬别的硬件。显卡互相等待,大量时间空转。硬件的潜力被困在软件的不匹配里,而不是困在芯片本身。

Meta-Infer 做了什么

工作分四个方向。

补齐内核。对不在验证名单里的硬件,框架不会报错,也不会崩溃,只会悄悄绕过加速路径。团队手动把它们打开:启用长输入的快速路径(sparse-MLA Prefill),把慢的矩阵乘内核换成更快的,并扩大卡间通信快速路径的覆盖范围。

算子优化与通信重构。把关键算子融合起来缩短单步耗时;让计算与卡间数据交换在时间上重叠,显卡不再互相干等;按 PCIe 的真实带宽重写集合通信逻辑,而不是照搬 NVLink 的参数。

并行与容量调优。预填充(Prefill)和生成(Decode)用不同的并行策略,动态调整键值缓存大小和静态显存占比,避免显存溢出和回退到慢路径。

缓存复用。面向长文本和视频,做带风险判断的缓存复用:哪些可以直接拿来用,哪些必须刷新,同时不掉回答质量。

服务器机房:一排暗色显卡与一排亮蓝色显卡,中间是流动的发光粒子

数字

所有测试都在同一套硬件上完成,没有修改模型权重和结构。

DeepSeek-V4.1-Flash:社区“第零天”基线版本的输入吞吐是每秒 1932 个 token,完成算模协同后到 5850,全套调优后到每秒 13274 个 token,也就是提升 6.87 倍,并支持最长 100 万 token 的上下文。

DeepSeek-V4-Flash:从每秒 14546 提升到 22584 个 token(1.55 倍)。

GLM 5.3:从每秒 3236.78 提升到 6222.72 个 token(1.92 倍)。首 token 的 P95 时延从 141.6 秒降到 46.6 秒,支持的上下文上限从 27 万 token 扩展到 105 万 token。

视频模型 MiniMax H3:15 秒参考图生视频的端到端速度提升 2.48 倍,峰值显存与原来持平;在八卡整机上,文生视频吞吐最高达到基线的 5.33 倍,参考图生视频达到 4.98 倍。

他们还单独提到一个改动:把共享专家和路由专家改为并行提交后,在 35 组同配置配对测试中带来 11.26% 的吞吐提升。

离顶级硬件有多远

和旗舰的差距比直觉中要小。按整机口径(八卡、5 秒、768P、16:9),这套配置每小时产出 296 条视频,而顶级 B300 是 439 条,约为 67%;参考图生视频是 131 对 225 条,约为 58%。作者估算,要在吞吐上打平,大约需要 2.6–2.9 台这样的机器对一台 B300;如果再叠上缓存和轻量微调方案,比例能降到 1.5–1.7 台。

换句话说,硬件差距并没有消失,但看得见的落后里,很大一部分不是芯片物理,而是软件没准备好。

别高兴太早

第一,所有数字都来自公司自己,目前没有第三方复现。测试用的是特定配置和特定框架版本,换硬件结果就会不同。

第二,PCIe 显卡的数据交换仍然比 NVLink 慢。软件能减少空转,但没法把通道变宽。在卡间通信关键的场景里,差距会一直在。

第三,这里算的是输入吞吐的提速,不是总拥有成本。便宜显卡省下的钱,可能被更多的机器数量和功耗吃掉一部分。

对普通用户意味着什么

最直接的结论是:跑模型的成本,越来越不只看芯片价格,也看软件栈的水平。如果这类优化铺开,同样的算力会更便宜——服务商就有了降价和在同一批硬件上承接更多请求的空间。

想看看现代模型的效果,可以在 NeuralSpace 聊天里试;生成图片在图片板块,视频在视频板块。

来源:量子位(QbitAI)。