← 所有文章

用 AI 让照片动起来:从静态图到动态短片

明亮构图:桌面上的纸质照片,其中一张化作光与运动的丝带消散

用 AI 让照片动起来,就是把一张静态照片变成几秒钟的动态短片:人物眨眼或转头,水面泛起波纹,镜头缓慢推进。技术上这叫 image-to-video:模型不是去修图,而是在画面里补上原本不存在的运动。在 NeuralSpace 上这件事在「视频」板块几步就能完成。下面说明该选哪个模型、什么样的照片动起来效果好,以及怎样用文字把运动描述清楚,免得反复重做。

「让照片动起来」是什么意思,又不是什么

image-to-video 拿一张现成画面当起点,补出后面发生的事:镜头运动、面部表情、光与水的流动。它既不是修复也不是放大——那些工具提升的是照片本身的细节,并不增加时间。动起来是在时间维度上工作:输出是一段短片,通常按模型不同为 4 到 30 秒。要记住,模型会自行编造画面里没有的东西,所以原图越干净、越简单,运动就越可信。

什么样的照片效果好

有个简单规律:一个清晰的主体处于焦点。半身人像、单独一个人物、前景鲜明的风景、中性背景上的商品,动起来都可预期。最难的是远景群像,以及同一画面里有几个同等重要主体的照片:模型会把所有人一起糊掉。发皱、偏暗或噪点很大的原图也能动,但脸上容易出现瑕疵。如果照片很旧有破损,先用修复工具处理,再拿来动。

在 NeuralSpace 上让照片动起来:分步操作

整个过程只要几分钟。打开「视频」板块,选择一个 image-to-video 模型。然后点击图片按钮上传照片,用文字描述想要的运动,需要时设置时长和分辨率,再开始生成。完成的短片会出现在历史记录里,可以直接下载。无需安装或配置:全部在浏览器中运行。

该选哪个模型

目录里有多个接受图片输入的模型,各有特点:

  • SeeDance 2.5 —— 通用之选:接受文本、图片和视频,时长 4–30 秒。需要可预期的镜头和主体运动时很合适。
  • SeeDance V1.5 Pro —— 一到两个参考图的简单路径,适合快速出结果。
  • Kling O1 Image-to-Video —— 专为图片设计,适合让人像和物体动起来。
  • Kling 3.0 与 Turbo —— 文本和图片转视频(std / pro),Turbo 更快。
  • VEO 3.1 与 Sora 2 —— 「文本或图片转视频」的强通用模型。
  • MiniMax H3 —— 支持带声音的视频,4–15 秒,最高 2K。
  • HappyHorse 1.0 —— 图片加文本,独立的 image-to-video 路径。

如果需要的不是单纯的运动,而是会说话的人像,请选「图片 + 音频转说话头像」模型(Kling AI Avatar、OmniHuman 1.5),或用 Wan 2.2 Animate 从视频参考里迁移运动。

怎样用文字描述运动

提示词要描述照片里没有的东西,也就是运动。不要写「让它动」,而要具体、只给一个动作:「微风拂动头发,镜头缓慢推进」「水面泛起波纹,云从右向左飘动」「人物平静地眨眼并微微一笑」。一条提示里塞的运动越多,结果越抖动,所以只保留一个主要动作。镜头的方向和速度也最好直接写清楚。

多少钱

NeuralSpace 没有订阅:新用户会获得初始 token,之后按 token 付费。价格取决于模型、时长和分辨率,并在开始前显示,因此在片子开始渲染前就能看到成本。为了避免花两次钱,每次只改一个参数。

NeuralSpace 的「视频」板块:选择模型并上传图片来让照片动起来

常见问题

可以让照片动起来免费吗?

没有长期免费的生成入口。新用户会获得初始 token 用来试用工具,之后按 token 计费,无需订阅。

人像用哪个模型好?

人像适合 Kling O1 Image-to-Video 和 SeeDance 2.5——在轻微运动时能较好地保住脸。会说话的人像则需要单独的「图片 + 音频」模型。

结果有多长?

取决于模型:SeeDance 2.5 为 4 到 30 秒,MiniMax H3 为 4 到 15 秒。短片比长片动得更稳。

需要会剪辑吗?

不需要。你上传照片、描述运动,就得到成品文件。生成后即可下载短片。