核心要点 (BLUF): VEO 3.1 Reference To Video 是一种 AI 视频模式,图像引导,文本跟随。上传一到三张参考图片——产品、角色、风格——并描述它们会发生什么。该模型将您可识别的物体带入一个全新的场景,而不是发明一个随机的替身。

普通一代每次都会重塑这个框架:向跑步运动员索要一双运动鞋,你得到的是一双运动鞋,而不是你的。参考模式正好解决了这个问题。您可以通过一到三张图像向模型展示特定对象,该对象就是出现在完成的剪辑中的对象。
参考文献不是打开或关闭框架——它们只是示例。该模型会研究您的物品或角色的外观,然后根据您的文本在其周围拍摄一个新场景。至少一张图片是强制性的;如果没有参考,该模式将无法启动。
在经典的图像到视频中,图片成为第一帧,动作由此产生——相同的构图、相同的角度。参考模式更自由:场景是根据您的提示从头开始构建的,而图像仅规定其参与者的外观。
两种模式适合不同的工作。让一张特定的照片栩栩如生属于标准VEO3.1。在从未被拍摄过的环境中展示您的产品,或者让一个角色经历一系列不同的剪辑——这就是视频参考的目的。

规则很简单:模型必须清楚地看到物体。使用清晰的图像,使拍摄对象占据画面的大部分,周围没有视觉混乱。对于形状复杂的物体,两个或三个角度可以帮助模型掌握体积而不仅仅是前视图。
在提示中,跳过描述参考已经显示的内容 - 而是描述场景和动作:对象在哪里,它周围有什么,相机如何移动,光线是什么样的。帧格式在以下选项中设置:16:9 横向、9:16 纵向或自动。
参考生成仅在“快速”层上运行 - 此处无法选择“精简”和“质量”,如果您尝试,表单会快速返回到“快速”。在实践中,这是一个优势:渲染很快就会返回,因此您可以一次性循环使用具有相同参考集的多个场景创意。
剪辑的成本取决于生成参数,并从站点范围的代币余额中支付。失败或拒绝的世代不需要付出任何代价。适用标准VEO内容规则:画面中不得有儿童、不得虐待动物、不得包含成人内容。
第一个大用例是电子商务:只需几张产品照片,您就可以拍摄列表、广告和社交帖子的剪辑,而无需租用工作室。夏季野餐时的酱汁瓶、城市跑步时的运动鞋、浴室大理石架上的面霜——所有这些都来自相同的三个参考。
第二个是带有反复出现的英雄的系列内容:品牌吉祥物、插图中的角色、标志性物品。准备一次参考资料,您就可以获得一整套视频,其中英雄在各个剪辑中保持一致。结果存储在历史记录中,可供下载或扩展。
一到三之间,至少需要一个 - 如果没有参考,该模式将无法启动。对于形状复杂的物体,提供两个或三个角度有助于模型准确捕捉形状。
Reference To Video 仅在 Fast 上运行;这是该模式的技术限制,并且该表单将任何其他选择重置回“快速”。好处是快速渲染和场景创意的廉价迭代。
该模型使物体保持可识别性,但这是生成,而不是复制——小细节可能会发生变化。从多个角度进行清晰的参考可以提高准确性,并且可以轻松地重新生成承接。