7440 亿参数模型跑在笔记本上:Colibrì 把专家留在 SSD 里
开源引擎 Colibrì 用纯 C 写成,没有任何外部依赖,能在普通笔记本上跑 7440 亿到 2.8 万亿参数的模型,而且不强制要求显卡。它靠的不是把模型压到面目全非:引擎把「专家」——那些并非每个 token 都用到的部分——留在硬盘上,只加载当前 token 真正需要的那几个。项目在 GitHub 上已接近 3.8 万星,目前支持九个模型家族。
这是个什么项目
Colibrì 是一个大模型推理引擎,作者是一位网名 JustVugg 的开发者。它最初只是在一台 12 核、25 GB 内存的笔记本上做的实验,如今在 GitHub 上已有 37,951 星和 4,124 次 fork。许可证是 Apache 2.0,代码全部开源。
引擎本体就是一个 C 文件加几个小头文件。运行时不需要 BLAS,不需要 Python,也不强制要求 GPU。用 gcc 或 clang 配合 OpenMP 即可编译,Linux、macOS 和 Windows 都有预编译版本。
为什么这件事能成立
关键在于现代模型的架构。GLM-5.2 有 7440 亿参数,但每个 token 实际只激活约 400 亿:路由器会挑选哪些「专家」来算这个 token。而且从一个 token 到下一个 token,真正变化的权重只有大约 11 GB。
于是项目的核心思路是:模型不必塞进快速内存,而是要放对位置。稠密部分(注意力、共享专家、词嵌入,约 170 亿参数)常驻内存,int4 下约占 9.9 GB。而 19,456 个路由专家(75 层 MoE,每层 256 个,外加 MTP 头,int4 下每个约 19 MB)放在硬盘上,约 370 GB,按需加载。

给权重做的 JIT
作者把引擎核心比作 JIT 编译器,只不过编译对象是权重。普通 JIT 不会把整个程序编译完,而是观察真正在跑什么,只编译热路径。Colibrì 押的是同一个注:参数不是要一直持有的状态,而是要在恰当时候送到的数据。
实测的路由热度决定哪个专家进入哪一层。每一层都有 LRU 缓存、学习得到的「热专家」固定存储,以及提前一层的预取:路由器先跑,等结果真正需要时,加载延迟已经藏在计算背后。跑得越久,引擎越能猜准你的热专家。
VRAM、RAM 和 NVMe 这三层,是同一批权重的不同放置层。快速内存少,改变的是速度,不是模型:权重精度和路由选择都不变,从 VRAM 取到的专家和从硬盘取到的专家结果完全一致。
数字
所有测试都用同一个 GLM-5.2 的 int4 容器,唯一变量是硬件,也就是专家住在哪里。
- 6 张 RTX 5090、专家全部常驻:每秒 5.8–6.8 个 token,首 token 约 13 秒。
- 纯 CPU 的 128 GB 台式机:缓存热起来后约每秒 1.8 个 token。
- 单张 RTX 5070 Ti 的笔记本:每秒 1.07 个 token。
- 项目起步的那台机器——12 核、25 GB 内存:冷缓存下每秒 0.05–0.1 个 token。这是项目诚实的下限。
另外单独测了两块独立 NVMe 硬盘的效果:解码速度提升 37.5%。第三块更慢的盘在加权分配后没有带来任何增益。
支持哪些模型
目前引擎覆盖九个模型家族,每个家族一个 C 文件,但底层 I/O、缓存、分词器等公共组件是复用的:
- GLM-5.2 和 GLM-5.3——7440 亿参数,硬盘上约 372 GB 和 419 GB,内存从 16 GB 起;
- GLM-5.3-Flash——3210 亿,支持图像;
- Inkling——9750 亿;
- Kimi K3——2.8 万亿参数,硬盘约 1.6 TB,内存从 32 GB 起,不需要 GPU;
- DeepSeek V4 Flash——2840 亿,DeepSeek V4.1 Flash——5520 亿,两者都支持图像;
- Qwen3.8-Flash-Next——1250 亿加 510 亿的 n-gram 记忆;
- Qwen3.6——350 亿,OLMoE——70 亿。
项目带一个实时指标的网页面板,还有一个单独的 Brain 页面,把 GLM-5.2 的全部 19,456 个专家可视化出来:能看到路由器刚刚点了哪个专家、它现在住在哪一层存储。此外还有本地集群模式:协调节点负责 token 和路由,其他机器上的专家工作节点承担计算。
作者自己怎么说
项目刻意不承诺稳定速度。说明里写得很直白:速度没有 SLA,语义有硬保证——实验必须靠可复现的测量证明自己,默认策略绝不会偷偷改变模型精度或路由逻辑。
有些想法目前仍是假设。学习得到的专家固定策略在重复性任务上有效,但可能对某个具体提示过拟合。投机解码在某些配置下不是提速,而是在专家命中率约 85% 时损失约 32%。直接磁盘访问(O_DIRECT)高度依赖硬盘型号。作者邀请社区来验证这些假设,包括发布负面结果。
这意味着什么
结论很简单:用大模型不一定非要租机架。只要模型是稀疏的,就可以按内存层级摆放,跑在桌子底下已有的机器上。速度会比较朴素——弱机器上每秒零点几个 token,快机器上每秒几个 token——但这是完整的本地运行,不是演示。
如果你只想直接和现代模型对话,不想折腾硬盘和编译,可以用 NeuralSpace 聊天;生成图片在图片板块,视频在视频板块。
常见问题
Colibrì 是什么?
一个用纯 C 写的大模型推理引擎。它不把整个模型放进快速内存,而是按层级摆放:一部分在内存,一部分在硬盘,有显卡时一部分在显存。
需要显卡吗?
不需要。显卡只会让它更快,而所有支持的模型都不强制要求显卡。速度主要由加载专家所用的硬盘决定。
速度有多快?
弱机器上每秒零点几个 token,快机器上每秒几个 token。它不是云端 API 的速度替代品,但确实是不租服务器的完整本地运行。
在哪里获取?
代码和预编译版本在 GitHub 上的开源仓库 JustVugg/colibri。来源:量子位(QbitAI)。