← Alle artikelen

Gemini Omni (ook bekend als Google Omni en Veo Omni): video's met karakters, stem en 4K

Gemini Omni - multimodale videogeneratie

Kort over het belangrijkste (BLUF)

Gemini Omni, Google Omni en Veo Omni zijn drie namen van één videomodel: ze bewaart één held in alle video's, spreekt deze uit en geeft maximaal 4K uit. Laten we eens kijken wat er achter het woord ‘Omni’ zit, hoeveel de opwekking kost en waar we moeten beginnen.

Dit model heeft drie namen, en je bent ze waarschijnlijk alle drie tegengekomen: Gemini Omni, Google Omni En Veo Omni. Sommigen noemen het door de familie Gemini, sommigen door de videolijn Veo, sommigen eenvoudigweg “omni” - we hebben het over hetzelfde neurale netwerk voor het genereren van video. Ze werkt voor ons in sectie "Video"., en je kunt het uitvoeren zonder abonnement, met betaling voor een specifieke generatie.

Wat zit er achter het woord "Omni"

Een regulier videomodel accepteert tekst of één afbeelding. Hier is de input gemengd: een tekstbeschrijving plus maximaal zeven afbeeldingen, video of audio als aanvullende context. Je hebt een video nodig in de geest van een specifiek frame en met de sfeer van een specifieke melodie - breng alles in één keer, het model houdt rekening met elke bron.

Dit verandert de formulering van het probleem. In plaats van de paragraaf ‘stel je een huis als dit voor, het licht zo’, laat je een foto van het huis zien en beschrijf je de actie alleen met woorden. De tekst is verantwoordelijk voor de plot, de bijlagen zijn verantwoordelijk voor het uiterlijk.

Personages: één held in alle video's

Het grootste probleem met conventionele generatoren is dat de held van video naar video verandert. In Gemini Omni is hiervoor een apart karaktertabblad: een held wordt één keer aangemaakt, hij wordt opgeslagen in je bibliotheek en vervolgens met één klik verbonden met elke generatie. Het uiterlijk blijft consistent van video tot video.

Zo zit de serie in elkaar: een virtuele presentator van een column, een merkmascotte, een personage voor kinderverhalen. Het is niet nodig om referenties elke keer opnieuw te uploaden en te hopen dat het model het gezicht zal "onthouden".

Gemengde input: tekst, beeld en geluid in één generatie

Stem: kant-en-klare presets en die van jezelf

De video kan meteen met geluid verschijnen. De instellingen hebben een set kant-en-klare stemmen - mannelijk en vrouwelijk, van zacht hoog tot laag met heesheid. Je kiest een stem, schrijft een regel in de beschrijving - en het personage spreekt precies in het kader. Als de presets niet geschikt zijn, wordt op basis van de basis uw eigen stem aangemaakt in het audiotabblad: deze komt ook in uw persoonlijke bibliotheek terecht. Dit is een manier voor het merk om één herkenbare stem achter al zijn video's te hebben.

Tot 4K, duur en frameformaat

Dit is een van de weinige modellen op de site met 4K-uitvoer: 720p, 1080p en 4K zijn beschikbaar. Duur - 4, 6, 8 of 10 seconden, horizontaal frame 16:9 of verticaal 9:16 voor sociale netwerken. De praktische route is eenvoudig: voer concepten uit op 720p, en een goede optie is om opnieuw op te starten op 1080p of 4K.

Hoeveel kost het?

De prijs is afhankelijk van de duur, kwaliteit en of je een video als input indient, en wordt vóór lancering altijd in het formulier getoond - je ziet het bedrag voordat je op de knop klikt. Er is geen abonnement: je betaalt voor een specifieke video uit het algemene saldo, je kunt deze opwaarderen met een Russische kaart. Een concept van vier seconden in 720p kost aanzienlijk minder dan een concept van tien seconden 4K, dus het testen van een idee is goedkoper dan meteen de finale opnemen.

Waar te beginnen

  1. Open modelpagina en maak van één tekst de eerste video - zo voel je hoe zij de beschrijvingen leest.
  2. Voeg een referentieafbeelding toe: laat de woorden de actie vertegenwoordigen en de afbeelding het uiterlijk van de scène.
  3. Voeg een stem en een lijn toe als iemand in het frame spreekt.
  4. Krijg een permanent personage als je een reeks video's met één held nodig hebt.

Houd bij het beschrijven van een scène de volgorde aan: wie bevindt zich in beeld, wat ze doen, waar het gebeurt, hoe de camera zich gedraagt. Vermeld uw reactie in een aparte zin. Deze structuur levert bij de eerste of tweede poging vrijwel altijd een samenhangende video op.

U zoekt een model met de naam Google Omni of Veo Omni - dit is hetzelfde: Gemini Omni hier beschikbaar. In de buurt, binnen sectie "Video"., er zijn andere videomodellen als je wilt vergelijken.

Gemengde input: tekst, beeld en geluid in één generatie
混合输入:在一次生成中使用文本、图像和声音

Veelgestelde vragen (FAQ)

Vraag: Hoe haal je het beste resultaat uit een neuraal netwerk?
Antwoord: Gebruik gedetailleerde aanwijzingen (beschrijvingen) in het Engels, stel de stijl en details van de scène in.

Vraag: Kunnen deze materialen gebruikt worden voor commerciële doeleinden?
Antwoord: Ja, de gegenereerde inhoud is geheel van jou.