核心要点 (BLUF): GeminiOmni是一款多模式人工智能视频生成器:除了文本提示之外,它还接受图像、视频、音频甚至保存的字符作为输入。用文字描述一个场景,用图片支持它,为对话选择一个声音,并拍摄一系列以同一英雄为主角的剪辑——所有这些都在一个模型中进行。

大多数视频模型都会拍摄文本或单张图片。 Gemini Omni 采用混合饮食:文本提示加上最多七个图像、视频或音频作为额外上下文。 Wan有一个受特定帧启发、承载特定曲目情绪的剪辑吗?一次性携带所有内容 - 模型会对您附加的每个源进行权重。
这会改变你制定任务的方式。你不需要用长段的文字来描绘“像这样的房子,那样的光”,你只需展示一张房子的照片,并只用文字来表达动作。文本驱动情节,附件定义外观——每种输入类型都有自己的工作。
普通生成器的缺点是英雄会从一个片段到另一个片段发生变异。这里通过一个专门的角色选项卡来解决这个问题:您创建一个角色一次,它就会进入您的个人库,从那时起您可以将其附加到任何一代。每个视频的外观都保持一致。
这就是系列节目的制作方式:虚拟节目主持人、品牌吉祥物、儿童故事中反复出现的英雄。只需在生成表单中单击鼠标右键即可从库中选取保存的角色 - 无需重新上传参考并希望模型“记住”脸部。

剪辑可以从一开始就有声音。这些设置提供了一系列预设的男声和女声,涵盖不同的音色和个性——从柔和、高亢到低沉、沙哑。选择一个声音,将台词放入提示中,角色就会在框架中说话。
如果没有一个预设适合,“音频”选项卡可让您在基本预设之上构建自定义语音。它加入您的个人图书馆并像标准图书馆一样插入各代。对于一个品牌来说,这意味着您发布的每个视频中都有一个可识别的声音。
Gemini Omni 是网站上少数具有 4K 输出的模型之一:可用分辨率为 720p、1080p 和 4K。剪辑长度为 4、6、8 或 10 秒;对于社交信息流,框架为宽屏 16:9 或垂直 9:16。价格与持续时间和质量成正比。
一个实用的例程:在720p中迭代草稿,其中生成更便宜且更快,然后在1080p或4K中重新运行获胜版本。完成的剪辑存在于您的生成历史记录中,您可以在其中下载它们、扩展它们或通过调整重新运行提示。
不要一次打开所有功能。仅根据文本制作第一个剪辑,以了解模型如何阅读描述。然后添加参考图像,然后添加声音,最后才设置一个持久的角色。每一步都增加了控制,但要求在措辞上更加谨慎。
在场景描述中保持经典的顺序:谁在画面中,他们做了什么,事情发生在哪里,相机的行为方式。如果有台词,请给它自己的句子。这种结构几乎每次在第一次或第二次尝试时都能获得连贯的剪辑。
混合输入和库。常规模型获取文本或一张图片;在这里,您可以组合文本、图像、视频和音频,并在顶部附加保存的角色和自定义声音。这使得它成为围绕一位英雄构建的连续剧内容的正确选择。
在“角色”选项卡中创建角色 - 它会保存到您的库中。然后在每一代中一键选择它。英雄的外观在各个剪辑中重复出现,无需重新上传参考。
是的。选择一种预设声音或在“音频”选项卡中构建您自己的声音,然后在场景描述中写入角色的台词。该模型渲染一个剪辑,其中英雄以选定的声音说出该台词。