← 所有文章

文字视频:如何描述一个场景,使其达到你想要的效果

一条光带从打字机中升起,展开到框架中。

简单说一下主要的事情(BLUF)

对于几乎每个人来说,文本中的第一个视频结果都是三秒钟的混乱 - 因为描述不包含主要内容。我们将场景分为五层:谁做什么、如何拍摄、光线和风格。以“坏→好”为例,并分析它最常出现问题的地方。

文中的第一个视频几乎对每个人来说都是不成功的。一个人写了“一段有猫的美丽视频”,在三秒钟内陷入混乱,并得出神经网络被高估的结论。

这与模型无关。事实上,场景描述不是搜索查询,而是操作员的一项小技术任务。我会告诉你它由什么组成。

一条光带从打字机中升起,展开成一个浮动的框架。

五层正常描述

模型会猜测您未说出的所有内容。他们说的越少,她猜测的越多,结果也离她脑子里的越远。因此,我们分层次来讲:

  • 框架内有谁或什么。 不是“猫”,而是“一只红猫坐在窗台上”。
  • 发生了什么事。 一项行动,而不是三项。 “把头转向窗户。”
  • 相机在哪里以及它如何移动。 “中景镜头,镜头慢慢拉近。”这一层最常被跳过,但它解决了一半的问题。
  • 光线和一天中的时间。 “窗外温暖的夕阳光,柔和的阴影。”
  • 心情或风格。 “平静、亲切,就像纪录片中一样。”

我们收集:“红猫坐在窗台上,慢慢地把头转向窗户。中景,镜头慢慢拉近。温暖的夕阳,柔和的阴影,平静的家的气氛。”这是技术规范,而不是愿望。

并排的两帧:左边模糊混乱,右边清晰有序

坏→好

实际练习中的几对:

  • “城市”→“雨中的夜街,霓虹灯倒映在水坑里,镜头在视线水平处缓慢前移。”
  • “美丽的咖啡”→“特写:牛奶细流倒入黑咖啡中,图案呈圆圈状扩散,柔和的侧光。”
  • 《女孩在行走》→《后中景:一个穿着长外套的男人沿着空旷的路堤行走,风吹乱了外套的下摆,灰色的早晨。》

注意到一个模式了吗?所有“好”选项都只有一个动作。这是主要规则:四秒是一个动作,而不是一个情节。

哪里最容易坏掉?

我经常看到三个错误。

事情太多了。 “一个人离开家,坐上汽车,绕城行驶,来到大海”——这不是一个视频,这是四个视频的故事板。该模型将尝试将所有内容放入其中,但什么也不做。

用抽象代替图片。 “大气”、“时尚”、“哇效果”——模特不知道它是什么样子。但他知道“低背光、画面中的烟雾、长长的阴影”。

框架中的文本。 该模型的铭文绘制效果仍然很差:字母写得歪歪扭扭,甚至是虚构的。如果您需要文本,请稍后在任何编辑器中添加。

关于格式

提前决定视频的去向。垂直 9:16 - 用于磁带和短裤,水平 16:9 - 用于网站和演示。稍后将无法在不丢失边缘的情况下重做格式;根据需要立即生成它更容易。

您可以尝试在 部分中编写自己的描述 视频生成,此任务的短暂着陆 - 文字视频。如果你不想从头开始,而是根据现成的模板,看看 趋势,场景已经为您描述过了,您所要做的就是添加自己的场景。

顺便说一句,如果你有合适的图片,将其变为现实往往比用文字描述场景更快: 免费生成视频的方法分析视频模型审查 将帮助您选择从哪里开始。

从关于相机的一个动作和一个短语开始。从那里它将自行发展。

常见问题 (FAQ)

问题:如何从神经网络中获得最佳结果?
答:使用详细的英文提示(描述),设置场景的风格和细节。

问:这些材料可以用于商业用途吗?
答:是的,生成的内容完全属于您。