MiniMax H3: 新しい AI ビデオ モデルで実際にできること
AI ビデオ モデルを公開する簡単な方法があります。それは、美しいポートレートではなく、動きを要求することです。空中で生地をねじったり、物体の周りにカメラを送ったり、水を岩に衝突させたりすると、弱い発電機が 1 秒以内に端を溶かし始めます。 MiniMax H3 は、そのピッチが写真映えする 1 つのフレームではなく、一貫した動きであるため興味深いです。
私たちは発売の背後にある完全な実践レビューを観察し、その技術的主張をMiniMaxのドキュメントと照合して確認しました。 「映画は死んだ」というノイズを除いて、ここが便利な部分です。
プロンプトと 1 枚の画像以上のもの
H3 は、1 つのリクエスト内のテキスト、画像、ビデオ、オーディオを理解します。テキストから生成したり、最初のフレームをアニメートしたり、開始フレームと終了フレームの両方をロックしたり、参照からクリップを構築したりできます。リファレンスには、キャラクター、動き、カメラ パス、ビジュアル スタイル、音声、または編集リズムを含めることができます。
それによって仕事が変わります。 「カメラはこのように動き、キャラクターは次のように見えます」という段落を書く代わりに、短いモーション クリップと別のスタイル イメージを表示できます。モデルの読み間違いが少なくなります。
公式の制限は寛大で、最大 9 つの参照画像、3 つのビデオ クリップ、3 つのオーディオ クリップ、合計 12 の混合ファイルです。参照ビデオとオーディオはそれぞれ最大 15 秒になる場合があります。プロンプトは 7,000 文字に達する場合があり、賢明なショートショットに通常必要な文字数をはるかに超えています。

はい、2Kと書いてあります。小さな文字を読む
出力は 768p または 2K で、クリップは 4 ~ 15 秒間実行されます。一般的なアスペクト比と適応モードがサポートされています。コンパクトなソーシャル広告には 15 秒もあれば十分です。オブジェクトを表示し、1 つのアクションを実行し、反応を示し、最後のショットに到達します。
しかし、解像度は品質ではありません。 MiniMax には、別の再生成パスも記載されています。768p の結果に適切な動きがあれば、元の入力とベース クリップを使用して 2K で再構築できます。それが賢明なワークフローです。まずテイクを見つけてください。次に解決策に費やします。
H3 が最も強く見える場所
レビューの最良の例には、シーンが変化しても一貫性を保つ必要があるカメラの高速移動、液体、布地、照明が含まれます。オーディオリファレンスは、それほど明らかではありませんが、勝利です。視覚的な素材とともに音声や音楽のリズムをガイドできます。
1 枚の静止画、6 秒間のカメラモーション参照、および短い音声アクセントを使用して撮影された製品を想像してください。静止画が製品を固定し、ビデオが軌道を提供し、オーディオがビートを設定します。それは「プレミアムなコマーシャルを作る」よりもはるかに正確です。
キャッチ
文字の一貫性はより優れていますが、保証されません。衝突し、互いに遮蔽してフレームに戻る複数のオブジェクトを追加しても、逸れたディテールや形状のジャンプが依然として表示される可能性があります。小さな読みやすい文字は、後でエディターで追加する必要があります。
そして、これらは短いクリップであり、完成した 3 分間の映画ではありません。より長いストーリーには、ショット リスト、安定した参照、編集が必要です。本当の仕事は残っている。 H3は主に生撮りステージを高速化します。
何かを教えてくれる最初のプロンプト
形容詞の山をスキップしてください。被写体、アクション、カメラ、照明を指定します。「濡れた黒い石の上にガラス瓶が立っています。その後ろで波が打ちます。カメラは右から左にゆっくりと弧を描きます。冷たい朝の光。クローズアップで仕上げます。」カメラ パスが重要な場合は、モーション参照をアタッチします。アイデンティティが重要な場合は、いくつかの角度を追加します。
独自のマテリアルでアイデアをテストするには、次のファイルを開きます。 NeuralSpace での AI ビデオ生成。まずきれいな開始フレームが必要ですか?で構築します 画像生成器。 768p で 5 ~ 6 秒から始めます。悪いものはコストが低くなります。良いものは 2K パスを獲得します。