MiniMax H3 开放权重:本地部署到底能跑什么
八月初,MiniMax 把旗下视频模型 H3 的权重发布到了 Hugging Face。现在你可以在自己的电脑上生成带立体声的视频片段——不用订阅,也不用为每一次生成支付 API 费用。但在下载几百个 GB 之前,有两件事必须清楚:完整的 2K 流水线没有进入开放版本,而且许可证并非对所有人、所有地区都放行。
到底开放了什么
MiniMax-H3 仓库包含两个面向不同任务的检查点。FL2VA 从文本生成带声音的视频,还能做帧动画:可以指定首帧、尾帧或两者同时指定。Ref2VA 则根据参考素材生成视频——单次请求最多可包含九张图片、三段视频和三个音频文件,人物形象、镜头运动、风格和声音各自用独立示例指定。模型核心是一个 330 亿参数的稠密 Transformer,权重以 BF16 精度发布,整个仓库约 288 GB。
模型能做什么
H3 接受文本、图像、视频和音频输入,输出 4 到 15 秒、24 帧每秒的视频片段——并带有模型自行合成、与画面同步的内置立体声。基础分辨率为短边 768p。这里的音频不是单独的处理环节,而是同一个模型的一部分:可以通过参考素材指定人声或音乐节奏,这明显改变了以往的工作流程。
关于 2K:一个重要提醒
宣传中的 2K 并不出自开放的那部分流水线。负责提升分辨率的是一个叫 Regenerate-2K 的独立模块,而 MiniMax 并未开放它:通往 2K 的官方路径是把本地的 768p 结果回传到该公司的云端 API。用于理解复杂提示与参考组合的 Context-IR 模块同样没有开放。所以「全部本地运行」目前意味着「运行基础生成」。

普通电脑跑得动吗?
ComfyUI 团队在发布当天就加入支持并做了大量优化:占参数总量约四成的调制权重被替换成紧凑的查找表,int8 量化把总体积从 123.6 GB 压到 42.5 GB。配合向内存的动态卸载,即便是一张 RTX 3060 这样的显卡也能运行该模型。社区走得更远:WanGP 上已经出现面向 5–6 GB 显存显卡的配置方案——激进的内存卸载、降低的分辨率,以及每个短视频数分钟的漫长等待。要注意这些是社区经验而非官方要求:画面细节会更软,稳定性则取决于内存大小和磁盘速度。想要完整质量,开发者推荐 RTX 5090 一类的高端卡。
许可证:这不是通常意义上的开源
权重是开放的,但按照附带条件的社区许可证分发。年营收低于 2000 万美元的公司可以商用,更大的企业需要另行签约。最关键的是地域限制:许可证只覆盖美国、欧盟、英国和韩国;在其他地区使用需要 MiniMax 的书面许可。因此准确的说法是「开放权重」,而不是「完全开源」。
谁真正需要本地部署
如果你在意隐私、大批量生成,或者想用自己的数据微调模型,自建实例才有意义——这正是开放权重的价值。如果只是想快速拿到高质量视频,不想折腾显卡农场和环境配置,云端更省事:在 NeuralSpace 视频板块几步点击就能出片,关于 H3 本身的能力我们在另一篇评测里有详细解读。
常见问题
MiniMax H3 需要什么显卡?
要流畅使用需要大显存的高端卡。实际上通过 ComfyUI 和 WanGP,6 GB 显存也能跑基础生成,代价是分辨率和速度:一个短视频可能要算上 10–15 分钟。
H3 可以商用吗?
可以,前提是公司年营收低于 2000 万美元——这是社区许可证的条件。更大的机构需要与 MiniMax 另行签约。
为什么不能说 H3 完全开源?
开放的只是流水线的基础部分:升到 2K 的模块和理解复杂参考的模块仍然闭源,而且许可证限制了商业使用和可用地区。