← 所有文章

MiniMax H3 开放权重:本地部署到底能跑什么

暗色桌面上的显卡,升起一条带有抽象画面的发光胶片

八月初,MiniMax 把旗下视频模型 H3 的权重发布到了 Hugging Face。现在你可以在自己的电脑上生成带立体声的视频片段——不用订阅,也不用为每一次生成支付 API 费用。但在下载几百个 GB 之前,有两件事必须清楚:完整的 2K 流水线没有进入开放版本,而且许可证并非对所有人、所有地区都放行。

到底开放了什么

MiniMax-H3 仓库包含两个面向不同任务的检查点。FL2VA 从文本生成带声音的视频,还能做帧动画:可以指定首帧、尾帧或两者同时指定。Ref2VA 则根据参考素材生成视频——单次请求最多可包含九张图片、三段视频和三个音频文件,人物形象、镜头运动、风格和声音各自用独立示例指定。模型核心是一个 330 亿参数的稠密 Transformer,权重以 BF16 精度发布,整个仓库约 288 GB。

模型能做什么

H3 接受文本、图像、视频和音频输入,输出 4 到 15 秒、24 帧每秒的视频片段——并带有模型自行合成、与画面同步的内置立体声。基础分辨率为短边 768p。这里的音频不是单独的处理环节,而是同一个模型的一部分:可以通过参考素材指定人声或音乐节奏,这明显改变了以往的工作流程。

关于 2K:一个重要提醒

宣传中的 2K 并不出自开放的那部分流水线。负责提升分辨率的是一个叫 Regenerate-2K 的独立模块,而 MiniMax 并未开放它:通往 2K 的官方路径是把本地的 768p 结果回传到该公司的云端 API。用于理解复杂提示与参考组合的 Context-IR 模块同样没有开放。所以「全部本地运行」目前意味着「运行基础生成」。

围绕显卡漂浮的带色彩渐变的透明玻璃立方体

普通电脑跑得动吗?

ComfyUI 团队在发布当天就加入支持并做了大量优化:占参数总量约四成的调制权重被替换成紧凑的查找表,int8 量化把总体积从 123.6 GB 压到 42.5 GB。配合向内存的动态卸载,即便是一张 RTX 3060 这样的显卡也能运行该模型。社区走得更远:WanGP 上已经出现面向 5–6 GB 显存显卡的配置方案——激进的内存卸载、降低的分辨率,以及每个短视频数分钟的漫长等待。要注意这些是社区经验而非官方要求:画面细节会更软,稳定性则取决于内存大小和磁盘速度。想要完整质量,开发者推荐 RTX 5090 一类的高端卡。

许可证:这不是通常意义上的开源

权重是开放的,但按照附带条件的社区许可证分发。年营收低于 2000 万美元的公司可以商用,更大的企业需要另行签约。最关键的是地域限制:许可证只覆盖美国、欧盟、英国和韩国;在其他地区使用需要 MiniMax 的书面许可。因此准确的说法是「开放权重」,而不是「完全开源」。

谁真正需要本地部署

如果你在意隐私、大批量生成,或者想用自己的数据微调模型,自建实例才有意义——这正是开放权重的价值。如果只是想快速拿到高质量视频,不想折腾显卡农场和环境配置,云端更省事:在 NeuralSpace 视频板块几步点击就能出片,关于 H3 本身的能力我们在另一篇评测里有详细解读。

常见问题

MiniMax H3 需要什么显卡?

要流畅使用需要大显存的高端卡。实际上通过 ComfyUI 和 WanGP,6 GB 显存也能跑基础生成,代价是分辨率和速度:一个短视频可能要算上 10–15 分钟。

H3 可以商用吗?

可以,前提是公司年营收低于 2000 万美元——这是社区许可证的条件。更大的机构需要与 MiniMax 另行签约。

为什么不能说 H3 完全开源?

开放的只是流水线的基础部分:升到 2K 的模块和理解复杂参考的模块仍然闭源,而且许可证限制了商业使用和可用地区。