← Alle Artikel

Gemini Omni (auch bekannt als Google Omni und Veo Omni): Videos mit Charakteren, Stimme und 4K

Gemini Omni – multimodale Videogenerierung

Kurz zur Hauptsache (BLUF)

Gemini Omni, Google Omni und Veo Omni sind drei Namen eines Videomodells: Sie behält in allen Videos einen Helden, spricht ihn aus und gibt bis zu 4K aus. Lassen Sie uns herausfinden, was sich hinter dem Wort „Omni“ verbirgt, wie viel die Erzeugung kostet und wo wir anfangen sollen.

Dieses Modell hat drei Namen, und Sie sind wahrscheinlich schon auf alle drei gestoßen: Gemini Omni, Google Omni Und Veo Omni. Manche nennen es bei der Familie Gemini, manche bei der Videoleitung Veo, manche einfach „Omni“ – wir sprechen von demselben neuronalen Netzwerk zur Videoerzeugung. Sie arbeitet für uns in Abschnitt „Video“., und Sie können es ohne Abonnement betreiben, mit Bezahlung für eine bestimmte Generation.

Was steckt hinter dem Wort „Omni“

Ein normales Videomodell akzeptiert Text oder ein Bild. Hier ist der Input gemischt: eine Textbeschreibung plus bis zu sieben Bilder, Video oder Audio als zusätzlicher Kontext. Sie benötigen ein Video im Geiste eines bestimmten Rahmens und mit der Stimmung einer bestimmten Melodie – bringen Sie alles auf einmal mit, das Modell berücksichtigt jede Quelle.

Dadurch verändert sich die eigentliche Formulierung des Problems. Anstelle des Absatzes „Stellen Sie sich ein Haus wie dieses vor, das Licht so“ zeigen Sie ein Foto des Hauses und beschreiben die Aktion nur in Worten. Der Text ist für die Handlung verantwortlich, die Anhänge für das Erscheinungsbild.

Charaktere: ein Held in allen Videos

Das Hauptproblem bei herkömmlichen Generatoren besteht darin, dass der Held von Video zu Video wechselt. In Gemini Omni gibt es dafür einen eigenen Charakter-Tab: Ein Held wird einmal erstellt, er wird in Ihrer Bibliothek gespeichert und dann mit einem Klick mit einer beliebigen Generation verbunden. Das Erscheinungsbild bleibt von Video zu Video gleich.

So setzt sich die Serie zusammen: ein virtueller Moderator einer Kolumne, ein Markenmaskottchen, eine Figur für Kindergeschichten. Es ist nicht nötig, Referenzen jedes Mal neu hochzuladen und darauf zu hoffen, dass sich das Model an das Gesicht „erinnert“.

Gemischter Input: Text, Bild und Ton in einer Generation

Stimme: vorgefertigte Voreinstellungen und Ihre eigenen

Das Video kann sofort mit Ton ausgegeben werden. Die Einstellungen verfügen über eine Reihe vorgefertigter Stimmen – männlich und weiblich, von sanft hoch bis tief mit Heiserkeit. Sie wählen eine Stimme, schreiben eine Zeile in die Beschreibung – und der Charakter spricht direkt im Bild. Sollten die Voreinstellungen nicht passen, wird im Audio-Reiter basierend auf der Basis-Stimme eine eigene Stimme erstellt: Sie landet auch in Ihrer persönlichen Bibliothek. Auf diese Weise kann die Marke hinter all ihren Videos eine einheitliche Stimme haben.

Bis zu 4K, Dauer und Bildformat

Dies ist eines der wenigen Modelle auf der Website mit 4K-Ausgabe: 720p, 1080p und 4K sind verfügbar. Dauer – 4, 6, 8 oder 10 Sekunden, horizontaler Rahmen 16:9 oder vertikal 9:16 für soziale Netzwerke. Der praktische Weg ist einfach: Führen Sie Entwürfe mit 720p aus. Eine gute Option ist ein Neustart mit 1080p oder 4K.

Wie viel kostet es

Der Preis hängt von der Dauer, der Qualität und davon ab, ob Sie ein Video als Eingabe einreichen, und wird immer vor dem Start im Formular angezeigt – Sie sehen den Betrag, bevor Sie auf die Schaltfläche klicken. Es gibt kein Abonnement: Sie bezahlen ein bestimmtes Video aus dem Gesamtguthaben, Sie können es mit einer russischen Karte aufladen. Ein viersekündiger 720p-Entwurf kostet deutlich weniger als ein zehnsekündiger 4K-Entwurf, daher ist das Testen einer Idee günstiger, als gleich das Finale zu drehen.

Wo soll ich anfangen?

  1. Offen Modellseite und machen Sie aus einem Text das erste Video – so werden Sie spüren, wie sie die Beschreibungen liest.
  2. Fügen Sie ein Referenzbild hinzu: Lassen Sie die Wörter die Aktion darstellen und das Bild das Erscheinungsbild der Szene.
  3. Fügen Sie eine Stimme und eine Zeile ein, wenn jemand im Rahmen spricht.
  4. Holen Sie sich einen permanenten Charakter, wenn Sie eine Reihe von Videos mit einem Helden benötigen.

Halten Sie bei der Beschreibung einer Szene die Reihenfolge ein: Wer ist im Bild, was macht er, wo passiert es, wie verhält sich die Kamera? Senden Sie Ihre Antwort in einem separaten Satz. Dieser Aufbau ergibt fast immer beim ersten oder zweiten Versuch ein stimmiges Video.

Sie suchen ein Model mit Namen Google Omni oder Veo Omni – das ist dasselbe: Gemini Omni hier verfügbar. In der Nähe, in Abschnitt „Video“., es gibt andere Videomodelle, wenn Sie vergleichen möchten.

Gemischter Input: Text, Bild und Ton in einer einzigen Generation
混合输入:在一次生成中使用文本、图像和声音

Häufig gestellte Fragen (FAQ)

Frage: Wie erzielt man mit einem neuronalen Netzwerk das beste Ergebnis?
Antwort: Verwenden Sie ausführliche Ansagen (Beschreibungen) auf Englisch, legen Sie den Stil und die Details der Szene fest.

Frage: Können diese Materialien kommerziell genutzt werden?
Antwort: Ja, der generierte Inhalt gehört vollständig Ihnen.