Kling 3.0 动作控制:将真实动作复制到任何角色照片上

核心要点 (BLUF): Kling 3.0 Motion Control 是一款围绕运动传输构建的 AI 视频生成器。向它提供角色的照片和某人移动的参考视频,它会渲染一个剪辑,其中您的角色执行这些精确的动作 - 舞蹈、行走、手势。外观来自图像,舞蹈来自镜头。这是该技术的第三代,也是最精确的一代。

一个插图吉祥物表演了从真实人类镜头中复制的病毒舞蹈

运动传递实际上是做什么的

假设您需要带插图的吉祥物来表演流行舞蹈。没有人为此预订动作捕捉工作室。相反,您上传一个真人跳舞的剪辑作为参考,附加吉祥物图像并生成。系统从视频中读取身体动作,并用您的角色逐帧重新执行。

这回避了文本提示视频的核心弱点:编排几乎无法用语言描述。在这里你从不描述它——你只是展示它。参考中发生的任何事情都会在输出中发生,由照片中的任何人执行:被拍照的人、品牌人物、手绘英雄。

3.0 如何改进版本 2.6

网站上提供了两代产品,它们之间的差距是真实存在的。版本3.0通过复杂的运动更好地保留了角色的身份,处理快速的姿势变化,更少的融化的手和漂移的脸,并且通常需要更少的重试才能获得可发布的镜头。对于任何想要被观众看到的东西,从这里开始。

它还引入了其前身所缺乏的控件:字符方向。您可以决定人物的位置和朝向是否应遵循参考视频或保持您上传的图像。这解决了老一代人典型的头痛问题,即肖像画中的角色尴尬地塞进风景画的场景中。

显示分辨率选项和字符方向选择器的生成设置

方向模式、分辨率和剪辑长度

选择“跟随视频”可使您的角色与参考中的表演者保持一致,并支持长达 30 秒的剪辑 — 足以播放完整的舞蹈部分或延长的短剧。选择“跟随图像”会保留图片的框架,但将输出限制为 10 秒。根据长度或对构图的保真度是否更重要来进行选择。

分辨率是一个简单的下拉菜单:720p用于快速草稿,1080p用于您打算发布的最终渲染。明智的工作流程是以 720p 进行廉价迭代,直到照片加参考配对点击,然后以完整的 HD 重新生成获胜者。结果存储在您的历史记录中以供下载或扩展。

选择有效的参考视频

最好的参考资料展示了一位表演者,完全在画面中,动作清晰,摄像机稳定。硬剪切、遮挡和晃动的镜头会扰乱运动跟踪。如果您从社交媒体借用舞蹈,请选择舞者从第一秒到最后一秒从头到脚都可见的镜头。

你的角色图像有类似的要求:至少显示人物腰部以上,摆出一个动作可以合理发展的姿势。瘫坐在扶手椅上的角色将无法优雅地从参照物中起跳。粗略地匹配起始姿势,并且运动的过渡保持平滑。

这在哪里能维持下去

营销人员无需聘请动画师即可为趋势驱动的活动制作品牌吉祥物动画。插画师用手机拍摄自己的画面,然后将动作交给他们所画的角色。创作者制作他们的化身表演特技的片段,而他们宁愿不亲自尝试。在每种情况下,参考镜头负责表演,人工智能负责选角。

有一条严格的规则:仅使用您有权使用的面孔和镜头。您自己的照片、您自己的角色、许可材料。考虑到这一点,该工具可以在几分钟而不是几周的时间内将一张静态图像加上一个借用的动作转换成完成的动画。

常见问题

这与普通的图像到视频模型有何不同?

标准的图像到视频模型从头开始或根据文本提示发明了运动。运动控制可复制您提供的视频中的运动,为您提供对编排的帧精确控制,这是任何书面提示都无法比拟的。

生成的剪辑可以多长?

当字符方向跟随参考视频时最多 30 秒,当字符方向跟随您的图像时最多 10 秒。无论哪种方式,输出持续时间都与您上传的参考素材相关。

我应该使用 3.0 还是旧的 2.6 版本?

默认为3.0:它通过要求较高的运动保持面部和细节稳定,并添加方向控制。版本2.6对于快速、低风险的实验仍然有意义,其中迭代速度比抛光更重要。

相似模型