Gemini Omni(又名Google Omni和Veo Omni):带有角色、语音和4K的视频
简单说一下主要的事情(BLUF)
Gemini Omni、Google Omni和Veo Omni是一位视频模特的三个名字:她在所有视频中保留一名英雄,为他们配音,并赠送最多4K。让我们弄清楚“Omni”这个词背后的含义、发电成本是多少以及从哪里开始。
该模型有三个名称,您可能遇到过这三个名称: Gemini Omni, Google Omni 和 Veo Omni。有些人称之为家庭Gemini,有些人称之为视频线Veo,有些人简称为“全能”——我们正在谈论用于生成视频的相同神经网络。她为我们工作 “视频”部分,您无需订阅即可运行它,只需为特定一代付费即可。
“Omni”这个词的背后是什么
常规视频模型接受文本或一张图片。这里的输入是混合的:文本描述加上最多七个图像、视频或音频作为附加上下文。您需要一个具有特定框架精神和特定旋律情绪的视频 - 立即带来所有内容,模型将考虑每个来源。
这改变了问题的表述方式。你展示了一张房子的照片,而不是“想象一个像这样的房子,像这样的光”的段落,并且只用文字描述了这个动作。文字负责剧情,附件负责外观。
角色:所有视频中的一位英雄
传统生成器的主要问题是英雄在视频之间发生变化。在Gemini Omni中有一个单独的角色选项卡:英雄被创建一次,他被保存到你的库中,然后一键连接到任何一代。各个视频的外观保持一致。
这就是该系列的组成方式:专栏的虚拟主持人、品牌吉祥物、儿童故事的角色。无需每次都重新上传参考资料并希望模型能够“记住”这张脸。

语音:现成的预设和您自己的预设
视频可以立即带声音出来。设置有一组现成的声音——男声和女声,从柔和的高音到低沉的沙哑。你选择一个声音,在描述中写下一行——然后角色就在框架中说话。如果预设不合适,则会在音频选项卡中根据基本声音创建您自己的声音:它最终也会出现在您的个人库中。这是该品牌在其所有视频背后拥有一个可识别声音的一种方式。
高达 4K、持续时间和帧格式
这是网站上为数不多的具有 4K 输出的型号之一:720p、1080p 和 4K 可供选择。持续时间 - 4、6、8 或 10 秒,水平框架 16:9 或垂直框架 9:16(适用于社交网络)。实用的路线很简单:以 720p 运行草稿,一个不错的选择是以 1080p 或 4K 重新启动。
它要多少钱
价格取决于时长、质量以及您是否提交视频作为输入,并且始终在启动前显示在表单中 - 您在单击按钮之前会看到金额。没有订阅:您从总余额中支付特定视频的费用,您可以使用俄罗斯卡充值。 4 秒 720p 草稿的成本远低于 10 秒4K,因此测试一个想法比立即拍摄结局更便宜。
从哪里开始
- 打开 模型页 并根据一个文本制作第一个视频 - 这样你就会感受到她是如何阅读描述的。
- 添加参考图片:让文字代表动作,让图像代表场景的外观。
- 如果有人在画面中讲话,请添加声音和台词。
- 当您需要一个英雄的一系列视频时,请选择一个永久角色。
描述场景时,请保持秩序:画面中的人物、他们在做什么、事情发生在哪里、相机的行为方式。用单独的句子提交您的回复。这种结构几乎总能在第一次或第二次尝试时产生连贯的视频。
您正在寻找名为 Google Omni 或 Veo Omni 的模型 - 这是相同的: Gemini Omni 可以在这里找到。附近,在 “视频”部分,如果你想比较的话还有其他视频模型。


常见问题 (FAQ)
问题:如何从神经网络中获得最佳结果?
答:使用详细的英文提示(描述),设置场景的风格和细节。
问:这些材料可以用于商业用途吗?
答:是的,生成的内容完全属于您。