MiniMax H3:新しいAI動画モデルの実力を検証
AI動画モデルのボロを出すには簡単な方法がある。綺麗なポートレートではなく、動きを要求すればいい。布を空中で捻る、カメラを物体の周りで回す、波を岩にぶつける——弱い生成モデルは1秒以内にエッジが崩れ始める。MiniMax H3が興味深いのは、フォトジェニックな1フレームではなく、一貫したモーションを売りにしている点だ。
我々はローンチ時の実機レビュー動画を全編視聴し、MiniMaxのドキュメントと技術的な主張を照合した。以下は「映画は終わった」的なノイズを除いた、実用的な部分だけをまとめたものだ。
プロンプトと1枚の画像以上のもの
H3は1回のリクエストでテキスト、画像、動画、音声を理解する。テキストから生成したり、最初のフレームをアニメートしたり、開始フレームと終了フレームの両方を固定したり、参照素材からクリップを構築したりできる。参照には、キャラクター、動き、カメラパス、ビジュアルスタイル、声、編集リズムを含めることができる。
これは作業の質を変える。「カメラはこう動いて、キャラクターはこう見える」と段落で書く代わりに、短いモーションクリップと別のスタイル画像を見せればいい。モデルが誤解する余地が少なくなる。
公式の制限は寛大だ:参照画像は最大9枚、動画クリップは3本、音声クリップは3本で、合計12個のファイルを混在できる。参照動画と音声はそれぞれ最大15秒。プロンプトは7,000文字まで——通常の短いショットに必要な文字数をはるかに超えている。

確かに2Kと書いてある。ただし注釈を読め
出力は768pまたは2Kで、クリップは4秒から15秒まで。一般的なアスペクト比とアダプティブモードがサポートされている。15秒あれば、コンパクトなソーシャル広告には十分だ:オブジェクトを見せ、1つのアクションを実行し、リアクションを示し、最終ショットで着地する。
ただし、解像度は品質ではない。MiniMaxは別の再生成パスも文書化している:768pの結果が正しいモーションを持っていれば、元の入力とベースクリップを使って2Kで再構築できる。これが賢明なワークフローだ。まずテイクを見つけ、次に解像度にコストをかける。
H3が最も優れている点
レビューの最良の例は、高速カメラワーク、液体、布、そしてシーンが変化する間も一貫性を保つ必要がある照明を含んでいる。音声参照は目立たない勝利だ。ビジュアル素材と並行して、声や音楽のリズムをガイドできる。
1枚の静止画像、6秒のカメラモーション参照、短い音のアクセントを使った製品ショットを想像してみてほしい。静止画は製品を固定し、動画は軌道を提供し、音声はビートを設定する。これは「プレミアムなコマーシャルを作って」よりもはるかに正確だ。
制約
キャラクターの一貫性は向上したが、保証されたわけではない。衝突し、互いに遮蔽し、フレームに戻る複数のオブジェクトを追加すると、細部のズレや形状のジャンプが依然として現れることがある。読める小さな文字は、後でエディターで追加すべきだ。
そして、これらは短いクリップであって、完成した3分間の映画ではない。長い物語にはまだショットリスト、安定した参照素材、編集が必要だ。実際の作業は残っている。H3が主に高速化するのは、素材ショット段階だ。
何かを学べる最初のプロンプト
形容詞の山は飛ばせ。被写体、アクション、カメラ、照明を具体的に指定しよう:「ガラスの瓶が濡れた黒い石の上に立っている。背後で波がぶつかる;カメラはゆっくり右から左に円弧を描く;冷たい朝の光;クローズアップで終わる。」カメラパスが重要な場合はモーション参照を添付する。アイデンティティが重要な場合は複数のアングルを追加する。
自分の素材でアイデアをテストするには、NeuralSpaceのAI動画生成を開こう。まずクリーンな開始フレームが必要?画像生成で構築しよう。768pで5〜6秒から始める。悪いテイクはコストが安く、良いテイクには2Kパスの価値がある。