MiniMax H3:新一代 AI 视频模型究竟能做什么
想快速看出一个 AI 视频模型够不够强,别让它只生成漂亮的人像,让画面动起来。布料翻卷、镜头绕物体移动、水浪撞上礁石——弱模型往往一秒后就开始融化边缘。MiniMax H3 值得关注,正因为它强调的是连续、可信的运动,而不是单张好看的截图。
我们完整看了发布后的实测视频,并把其中的技术说法与 MiniMax 官方文档逐项核对。下面不谈“电影行业终结”,只谈创作者真正能用上的部分。
不再只是文字加一张图
H3 能在同一个任务中理解文字、图像、视频和音频。你可以纯文字生成,也可以让首帧动起来、同时锁定首尾帧,或用多个参考素材创建视频。参考素材可以负责人物、动作、运镜、风格、声音或剪辑节奏。
工作方式因此变了。与其写一大段“镜头如何移动、角色长什么样”,不如给它一段动作参考和一张风格图,模型猜错的空间会小得多。
官方规格支持最多 9 张参考图、3 段参考视频和 3 段音频,混合素材总数上限为 12 个。参考视频和音频各自总时长不超过 15 秒,提示词最长 7000 字符。对一个短镜头而言已经很充裕。

确实支持 2K,但别忽略小字
输出可选 768p 或 2K,时长为 4 到 15 秒的整数,支持常见画幅和自适应比例。15 秒足以讲完一个社交媒体小广告:产品出现、完成一个动作、给出反应,再落到结束镜头。
不过,2K 这个数字不会自动带来好视频。官方还提供单独的“重新生成”流程:先在 768p 找到运动正确的版本,再用原始输入和基础视频重建为 2K。这个顺序更省钱——先挑对镜头,再为清晰度付费。
H3 在哪些场景更有优势
实测中更出色的是快速运镜、液体、布料,以及场景变化时仍需保持合理的光线。音频参考则是容易被忽略的亮点:它既能提供声音参考,也能给画面一个音乐节奏。
举个实际例子:一张产品图、一段 6 秒的环绕运镜视频,再加一个短促的声音重音。图片固定产品外观,视频规定镜头轨迹,音频决定高潮点。这比一句“做一个高级广告”准确得多。
演示片没有说完的限制
人物一致性变好了,但不是绝对保证。多个物体碰撞、互相遮挡后又回到画面时,仍可能出现多余细节或形状跳变。画面中的小字也别交给模型,后期加字更稳。
此外,它生成的是短片段,不是一部现成的三分钟电影。长故事依然需要拆镜头、固定参考素材并完成剪辑。工作没有消失,只是原始镜头的制作快了。
第一个提示词这样写
别堆形容词,写清四件事:主体、动作、镜头和光线。例如:“玻璃瓶放在潮湿的黑色石头上,海浪从后方拍来,镜头从右向左缓慢环绕,冷色晨光,最后以特写结束。”运镜必须准确时附上视频参考,人物或产品必须稳定时提供多个角度。
想用自己的素材测试,可以打开 NeuralSpace 视频生成。如果还缺一张干净的首帧,先去 图像生成器制作。建议从 768p、5 到 6 秒开始:失败版本更便宜,成功的镜头再升级到 2K。