← すべての記事

Gemini Omni (別名 Google Omni および Veo Omni): キャラクター、音声、4K を含む動画

Gemini Omni - マルチモーダルビデオ生成

主要なこと(BLUF)について簡単に説明します。

Gemini Omni、Google Omni、Veo Omni は 1 つのビデオ モデルの 3 つの名前です。彼女はすべてのビデオで 1 人のヒーローを保持し、それらに声を当て、最大 4K を与えます。 「オムニ」という言葉の背後にあるもの、発電コストがどれくらいかかるのか、そしてどこから始めればよいのかを理解してみましょう。

このモデルには 3 つの名前があり、おそらく 3 つすべてを目にしたことがあるでしょう。 Gemini Omni, Google Omni そして Veo Omni。これをファミリー Gemini と呼ぶ人もいますし、ビデオ ライン Veo と呼ぶ人もいます。単に「オムニ」と呼ぶ人もいます。これは、ビデオを生成するための同じニューラル ネットワークについて話しています。彼女は私たちのために働いています 「ビデオ」セクション、サブスクリプションなしで、特定の世代に対して支払いを行うだけで実行できます。

「オムニ」という言葉の裏には何があるのか

通常のビデオ モデルは、テキストまたは 1 つの画像を受け入れます。ここでは入力が混合されています。テキストの説明に加えて、追加のコンテキストとして最大 7 つの画像、ビデオ、またはオーディオが含まれています。特定のフレームの精神と特定のメロディーの雰囲気を持つビデオが必要です。すべてを一度に取り込むと、モデルは各ソースを考慮します。

これにより、問題の定式化自体が変わります。 「こんな家、こんな光を想像してください」という文章の代わりに、家の写真を見せて、その行為を言葉だけで説明しています。テキストはプロットを担当し、添付ファイルは外観を担当します。

キャラクター: すべてのビデオに 1 人のヒーロー

従来のジェネレーターの主な問題は、ビデオごとに主人公が変わることです。 Gemini Omni には、このための別のキャラクタータブがあります。ヒーローは一度作成され、ライブラリに保存され、ワンクリックで任意の世代に接続されます。外観はビデオごとに一貫しています。

コラムのバーチャルプレゼンター、ブランドのマスコット、童話のキャラクターなど、シリーズはこのように組み立てられています。毎回参照を再アップロードする必要はなく、モデルが顔を「覚えている」ことを期待できます。

混合入力: 1 世代でテキスト、画像、音声

音声: 既製のプリセットと独自の

音声付きですぐに映像が出てきます。設定には、柔らかい高音からかすれ声のある低音まで、男性と女性の既製の声のセットが含まれています。声を選択し、説明文に一行を書き込むと、キャラクターがフレーム内で正しく話します。プリセットが適切でない場合は、ベースの音声に基づいてオーディオ タブで独自の音声が作成され、個人ライブラリにも保存されます。これは、ブランドがすべてのビデオの背後に 1 つの認識可能な声を持たせる方法です。

最大 4K、期間とフレーム形式

これは、4K 出力を備えたサイト上の数少ないモデルの 1 つです: 720p、1080p、および 4K が利用可能です。期間 - 4、6、8、または 10 秒、ソーシャル ネットワークの場合は水平フレーム 16:9 または垂直フレーム 9:16。実際的な方法は簡単です。ドラフトを 720p で実行し、1080p または 4K で再起動するのが良い選択肢です。

いくらかかりますか

価格は、期間、品質、入力としてビデオを送信するかどうかによって異なり、常に起動前にフォームに表示されます。金額はボタンをクリックする前に表示されます。サブスクリプションはありません。特定のビデオの料金は一般残高から支払い、ロシアのカードで補充できます。 4 秒の 720p ドラフトは 10 秒 4K よりも大幅にコストが低いため、アイデアをテストする方が、すぐに最終回を撮影するよりも安価です。

どこから始めるべきか

  1. 開ける モデルページ そして、1 つのテキストから最初のビデオを作成します。こうすることで、彼女が説明をどのように読んでいるかを感じることができます。
  2. 参照画像を追加します。言葉でアクションを表し、画像でシーンの外観を表します。
  3. 誰かがフレーム内で話している場合は、音声とセリフを含めます。
  4. 1 人のヒーローが登場する一連のビデオが必要な場合は、永続的なキャラクターを入手してください。

シーンを説明するときは、フレーム内に誰がいるのか、何をしているのか、どこで起こっているのか、カメラがどのように動作するのかなどの順序を保ちます。回答は別の文で送信してください。この構造では、ほとんどの場合、1 回目または 2 回目の試行で一貫したビデオが生成されます。

Google Omni または Veo Omni という名前でモデルを探しています - これは同じです: Gemini Omniはこちらから入手可能。近くの、 「ビデオ」セクション、比較したい場合は、他のビデオモデルがあります。

混合入力: 単一世代のテキスト、画像、サウンド
混合输入:在一次生成中使用文本、图像和声音

よくある質問(FAQ)

質問: ニューラル ネットワークから最良の結果を得るにはどうすればよいですか?
回答: 英語の詳細なプロンプト (説明) を使用し、シーンのスタイルと詳細を設定します。

質問: これらの素材は商業目的で使用できますか?
回答: はい、生成されたコンテンツは完全にあなたのものです。