← 所有文章

声音克隆:如何录制样本,用自己的声音朗读文本

明亮通透的场景:白色桌面上的麦克风,从中升起鲜艳的声波,旁边有两道相同的波形和一个播放按钮

声音克隆是「视频头像」分区中的一个标签页,用一段录音就能做出你声音的数字副本:上传文件,或用麦克风录下 10 秒到 3 分钟的语音,给克隆起个名字——之后就能用这个声音朗读任何文本和视频,不必再回到麦克风前。克隆在服务器上训练,会进入共享的声音目录,并在「头像与生成」和「文字转语音」标签页中可用。下面讲清如何录好样本、界面里该选什么、克隆用在哪里,以及费用如何。工具位于「声音克隆」标签页。

NeuralSpace「视频头像」分区,声音克隆标签页:样本上传与麦克风录制、声音名称输入框、语言提示、去除噪声选项、代币价格和「克隆声音」按钮,下方是「我的声音克隆」列表

声音克隆做什么

这个标签页用一段你的录音,训练出一个能朗读任何文本的声音模型。流程是:附上样本——文件或麦克风录音都行——输入声音名称,需要时指定语言并保持去除背景噪声开启,然后点击「克隆声音」。训练在服务器上进行:克隆会出现在「我的声音克隆」区块,状态为「训练中」,几分钟后变为就绪。就绪的克隆会立即进入共享声音目录——你可以像使用目录里任何声音一样,用它朗读文本和视频。

为什么需要它

  • 视频里的本人声音:用自己的音色给片子配音,每次修改都不必重录。
  • 文章和邮件的音频版:录一次样本,之后想读多少文本都行。
  • 规模化:脚本改动不再需要重新进棚录音。
  • 统一的品牌声音:一个克隆用于所有片子、课程和公告。
  • 多语言:克隆可用于目录中不同语言的配音。
  • 省时间:不必因为一句口误而整段重录。

如何在网站上开始:分步操作

  1. 在「视频头像」分区打开「声音克隆」标签页并登录——登录后才会加载克隆历史和声音目录。
  2. 附上样本:用上传按钮传音频文件,或用「用麦克风录制」直接在页面上录音。
  3. 输入声音名称——例如「我的声音」或「课程配音」。
  4. 需要时填写语言提示(en、ru 等);留空则自动识别语言。
  5. 保持「去除背景噪声」勾选——克隆会更干净。
  6. 查看代币价格:启动前就会显示。
  7. 点击「克隆声音」。克隆会出现在「我的声音克隆」区块,等状态变为「就绪」。
  8. 用名称旁的按钮试听克隆,然后在「头像与生成」标签页里使用它。

如何录好样本

克隆质量取决于样本,所以值得花两分钟认真录。长度:10 秒到 3 分钟——太短的一句话不够,三分钟通常足够。用平常语速平稳自然地说话,不要耳语也不要喊。在安静的房间里录,不要有音乐、回声和设备嗡鸣;如果仍有噪声,就保持去除背景噪声开启。读连贯的文本——文章里的一段或几句话——而不是孤立的单词:这样模型更能抓住语调。录制过程中不要改变与麦克风的距离。如果录成文件,普通音频格式、不做强压缩即可。

就绪的克隆用在哪里

克隆会进入共享声音目录,因此凡是其他声音能用的地方它都能用。在「头像与生成」标签页里,它给头像视频配音:选克隆代替目录声音,头像就用你的音色说话。在「文字转语音」标签页里,克隆可以朗读文章、信件和脚本,无需视频。如果片子需要翻译,在「视频翻译」里用克隆很方便,让其他语言也保持同一个声音。

与分区其他标签页的配合

克隆是流水线里能发挥作用的底料。先创建克隆,再在「文字转语音」标签页里用它朗读文本,或放进「头像与生成」标签页的视频里,最后在「视频翻译」里翻译成片。如果文本来自别人的录音,「口头禅去除」「译文校对」会派上用场。如果不再需要这个克隆,从历史里删除即可——名额会释放。

克隆的费用

平台以代币计费,无需订阅:新用户注册即获赠初始代币,之后可按需充值。创建克隆的价格是固定的,在点击按钮之前就显示在界面上——显示多少就扣多少。如果训练失败,代币会退回余额。用就绪的克隆朗读则单独计费——按文本长度,和其他任何声音一样。

常见问题

克隆的样本要录多长?

10 秒到 3 分钟。太短的一句话不够——模型抓不住音色——三分钟通常足够。最佳是 30–60 秒连贯语音,在安静的房间里录制。

不用麦克风也能克隆声音吗?

可以。上传一段现成的语音录音文件就够了。只有想直接在页面上录样本时才需要麦克风——标签页里有「用麦克风录制」按钮。

克隆之后用在哪里?

克隆会出现在共享声音目录里:在「头像与生成」标签页给头像视频配音,在「文字转语音」标签页朗读文本。如果片子要译成其他语言,也可以在「视频翻译」里使用克隆。

克隆效果不好怎么办?

从历史里删除它——名额会释放——再用更干净的样本重新创建:房间更安静、语速更平稳、开启去除背景噪声。如果训练失败,代币会退回余额。