← 所有文章

vLLM 团队把 Kimi K3 跑在 Google TPU 上,比 NVIDIA GPU 快 57%

由发光数据流连接的浅色玻璃加速模块

由开源推理引擎 vLLM 的创建者和核心维护者创办的 Inferact 公布了一个出人意料的结果:在 16 块 Google TPU v7 张量加速器上,Kimi K3 每秒能输出 709 个 token,而 16 块 NVIDIA GB200 只有 452 个,TPU 领先 57%——尽管 NVIDIA 的硬件纸面参数更强。秘诀不在芯片,而在软件层:团队写了一个「巨型内核」(megakernel),把数百个小算子合并成一个程序。代码已经开源。

到底比了什么

Inferact 把 TPU 和 GPU 放在完全相同的条件下:两边各 16 块加速器,同一个 Kimi K3 模型,同一个 vLLM 引擎,唯一的变量是芯片和底层内核实现。开启推测解码后,TPU 跑出每秒 709 个 token,GB200 为 452 个。

关掉推测解码只看裸速,差距依然存在。批大小为 1 时,TPU 每秒 249 个 token,GB200 只有 127 个,接近一倍;批大小为 8 时是 865 对 636。换成另一个模型 Qwen 3.8 27B,差距更大:4 块 TPU 达到每秒 1515 个 token,4 块 GPU 只有 695 个。

由发光数据流连接的浅色玻璃加速模块

为什么「更弱」的芯片反而更快

纸面上 TPU v7 Ironwood 和 GB200 很接近:BF16 峰值算力 2.31 对 2.5 PFLOPS,FP8 为 4.61 对 5 PFLOPS。而在显存带宽上 TPU 甚至落后:7380 GB/s 对 8000 GB/s。也就是说,NVIDIA 的显存更快,推理却更慢。差别不在硬件,而在硬件怎么用。

大模型推理的瓶颈不是计算,而是搬数据。每生成一个 token,都要把模型全部权重过一遍芯片:从 HBM 主存搬进片上缓存、算完,下一个 token 再搬一遍。传统做法把这一步拆成数百个独立的小程序,也就是内核。上一个内核干完、下一个还没启动的空隙里,显存带宽就在空转,这些空隙累加起来就是实打实的损失。

巨型内核:一个程序顶一百个

Inferact 的思路是消掉内核之间的边界。整个 Kimi K3——92 层混合专家(MoE)——被塞进一个用 Pallas 写的程序里。Pallas 是 TPU 的底层编程语言,地位相当于 NVIDIA 的 CUDA。边界消失后,下一层的权重可以提前开始加载:第 N 层还在算专家时,第 N+1 层的注意力权重已经在从显存往片上搬,显存几乎不空转。

这一招和 TPU 的架构很契合。TPU v7 的每个张量核心有 64 MiB 片上高速内存,放什么、什么时候释放,全由程序员决定。GPU 的组织方式不同:整卡约 38 MiB,分散在 152 个 SM 里并由硬件调度,没有空间提前把权重摆好。

一个意外的好处是编译速度。传统 TPU 编译器编译大模型经常要 30 分钟以上,而 Inferact 的巨型内核从零编译不到 90 秒。对工程师来说,这就是「明天才能验证改动」和「一分钟就能验证」的区别。

推测解码与精度

第二层加速来自 DeepSeek 团队提出的 DSpark 推测解码方案:小模型先快速猜出一串候选 token,大模型再批量验证,猜对的直接通过,猜错的回退重来。在 TPU 上,平均接受长度达到 6 个 token,单步解码耗时约 8.5 毫秒。

重要的是,速度没有以精度为代价。在贪心解码和最高推理强度下,巨型内核在 GPQA-Diamond 上拿到 94.4%,在 GSM8K 上拿到 97.2%,与 GPU 上的结果完全一致。

是谁做的

Inferact 是一家由 vLLM 团队出身的成员创办的公司,vLLM 是目前最流行的开源推理引擎。CEO Simon Mo 是 vLLM 的维护者之一,联合创始人 Woosuk Kwon 是项目发起人和 PagedAttention 算法的作者,首席科学家游凯超来自清华大学。今年公司完成了 1.5 亿美元种子轮融资,估值 8 亿美元。这次巨型内核的工作是与 Google Cloud 的联合项目,代码全部开源。

实际意味着什么

结论很简单:在推理速度的竞赛里,硬件已经不是唯一的决定因素。同一档次的两种芯片、同一个模型、同一个引擎,速度却差出 1.5 倍,而差距全在软件层。对为算力付费的人来说,这意味着优化代码可能比买新加速器更划算。

当然也有诚实的保留。巨型内核目前只针对 Kimi K3 的具体架构和 16 块芯片的特定配置,换模型或换芯片数量都要重写。这是第一步,而不是现成的通用方案。

常见问题

什么是巨型内核?

一个把整个模型前向过程一次跑完的大程序,取代数百个独立小算子。这样内核之间的停顿消失了,显存也能提前预取数据。

TPU 现在比 GPU 更适合 AI 了吗?

不能一概而论。这里比的是一个很窄的场景:小批量下跑单个模型。在训练等其他任务上,局面可能不同。但结果说明,软件优化足以盖过硬件上的差距。

普通用户能体验 Kimi K3 吗?

可以,模型权重已经开放。你可以在 NeuralSpace 聊天里和它对话,也可以在代码板块尝试智能体式的工作流。