核心要点 (BLUF): HappyHorse Reference-to-Video 是一款 AI 视频生成器,它基于整组图片而不是单个图片。上传最多九张参考图像,并用文本描述它们如何组合:一张照片中的角色、另一张照片中的一套服装、第三张照片中的地点——模型将它们合并成一个连贯的剪辑。

该模式的定义特征是每代最多九个参考。每个图像在未来的剪辑中都扮演着一个角色:英雄、第二个角色、道具、地点、风格样本。您的提示解释了谁是谁以及发生了什么:“第一张照片中的男人坐在第三张照片中的咖啡馆里,拿着第二张照片中的杯子”。
这解决了普通图像到视频无法触及的问题:将从未一起拍摄过的事物放入一帧中。来自不同拍摄的产品和模型、彩绘背景下的角色、来自不同场景的两个英雄——它们最终都出现在同一个场景中,无需任何手动合成。
网络不会将您的图片粘贴到框架中。它研究它们——角色的外观、物体的形状、地点的调色板——并重新绘制运动中的一切。这就是为什么英雄可以转身、行走和捡起东西,同时保持可识别性。参考越干净,主题周围的杂乱越少,传输就越忠实。
用语言来帮助它:明确分配角色并描述关系。 “图 1 中的女人穿着图 2 中的夹克,沿着图 3 中的街道行走”比含糊其辞的“用这些照片制作一个漂亮的视频”要好得多。您定义铸造;模型只需让场景栩栩如生即可。

与单张照片模式不同,此处的宽高比由您选择:宽屏 16:9、垂直 9:16 和 3:4、方形 1:1 和经典 4:3。相同的参考集可以成为网站的垂直故事剪辑和宽横幅视频 - 只需切换格式并重新运行即可。
持续时间范围为 3 至 15 秒,输出为 720p 或 1080p。 720p 的廉价短稿非常适合探索想法;将较长的 1080p 渲染保存为最终版本。种子字段可让您锁定您喜欢的构图,并且仅更改措辞。
最有价值的场景是具有持久角色的视频系列:品牌吉祥物、喜剧英雄、虚拟主持人。将相同的角色图像输入到每一代中,你会得到一系列英雄保持不变的剪辑。对于商店来说,这是一种通过将照片与内部照片配对来“在现实生活中”展示产品的方式。
它在创意工作中也大放异彩:根据孩子的画作和照片构建童话场景,将宠物放入插图世界,将服装草图与真实模型结合起来。过去需要拼贴和手动修饰的一切都发生在一代人的时间内。
不要急于填满所有九个插槽。添加的图像越多,模型就越难决定什么是重要的。从两个或三个关键参考开始——英雄、物体、背景——只有当剪辑明显缺少特定细节时才添加更多。每一张额外的图片都会稀释网络的注意力。
注意兼容性:白天在霓虹灯闪烁的街道上拍摄的角色迫使模型即兴发挥,接缝开始显现。具有相似照明和接近颜色范围的参考会产生统一的图片,从第一帧开始看起来就很可信。
每代从一到九。两到三个关键参考——英雄、道具、背景——是最好的起点。仅当您确切知道每个新图像负责场景的哪些细节时才添加更多图像。
模型努力保持身份,通常相似度都很好,但这是新一代,而不是照片的复制品。画面中没有其他人的清晰特写肖像,再加上保持外观的明确指示,可以改善匹配度。
常规图像到视频可以使一张图片动起来并保持其构图。在这里,您带来几张源图像,模型根据您的描述构建一个全新的场景。当您需要的确切镜头根本不存在时,请选择此模式。