← 所有文章

配音 Gemini TTS:30 种语音和所有设置

窗边明亮的录音室:两个麦克风、耳机和彩色声波、带对话台词的柔软浮动卡、大量光线

在「音频」板块上线了一个新工具——Gemini TTS 对话配音。它能把现成的脚本直接变成声音:你设定说话者、他们的声音和性格,服务会依次为每一句台词配音,最后返回一个现成的 MP3 文件。

音频部分:Gemini TTS配音工具,配置了两个扬声器、对话台词、温度滑块和开始前显示的价格

这是什么乐器

这不是用一种声音朗读一篇文章,而是一篇完整的文章 多人对话。每个角色都有自己的声音、口音、演示风格和节奏 - 而且台词听起来就像他们想要的那样:演示者之间的对话、短剧、采访、视频中角色的台词。

有两种型号可供选择:

  • Gemini 3.8 Flash TTS — 富有表现力的配音:情感更丰富,节奏更自然,传递控制更精细。适用于播客、有声读物、画外音。
  • Gemini 3.8 Flash-Lite TTS —同样的机制更便宜、更快:对于大卷、草稿和大声朗读文本。

有哪些设置可用?

界面显示了配音模型提供的所有参数:

  • 扬声器。 从一个到几个字符;每个都有自己的签名“Speaker 1”、“Speaker 2”等,通过这些签名将副本与语音相关联。
  • 30 票 - 从柔和的叙事到充满活力的“新闻”。
  • 8种口音 - 中立,美国(一般,“山谷”,南部),英国(RP和布里克斯顿),跨大西洋,澳大利亚。
  • 6 种服务风格 ——声音中的微笑、播音员、低语、同理心、宣传和“干”均匀的语气。
  • 4 语速 - 自然、流畅、流畅的“漂移”和生涩。
  • 配音角色 - 自由描述,例如“温暖的讲故事的人”或“严厉的看门人”。
  • 温度 - 从 0 到 2:较低 - 更加稳定和可预测,较高 - 更加活跃且更加多样化。
  • 场景和总体基调 - 对环境的描述(“一个安静的房间,有噼啪作响的壁炉”)和叙述风格(“一本有声读物,柔和而诱人”)。
  • 复制品 — 每行对话最多 10,000 个字符;副本的顺序被保留。

如何进行语音对话:一步一步

  1. 打开 “音频”部分 并选择型号 Gemini 3.8 Flash TTS 或者 Flash-LiteTTS - 它们位于型号列表的底部。
  2. 添加扬声器并自定义每个人的声音、口音、风格和节奏。
  3. 写下对话台词并确定每句台词的说话者。
  4. 如果需要,请填写场景描述、整体色调和温度。
  5. 查看价格 - 它在发布之前可见,并在您输入文本时重新计算。
  6. 单击“语音”,准备好后,收听结果并下载MP3。

它要多少钱

价格是根据实际文本量来计算的:复制品越长,成本就越高,而且在推出前就可见——一代后就没有什么惊喜了。与其他付费代一样,使用站点代币进行支付;如果不成功,则自动返回令牌。价格指南可以直接以以下形式查看:输入脚本时金额会更新。

常见问题

我可以为两个或多个角色之间的对话配音吗? 是的,每个扬声器都有自己的声音和设置,线路轮流。

结果是什么格式? MP3 - 页面即可收听,一键下载。

模型会说哪些语言? 该模型是多语言的:它可以用数十种语言来语音文本,包括俄语和英语。

选择什么:Flash 还是Flash-Lite? 对于富有表现力的项目 - Flash,对于大容量和草稿 - Flash-Lite:机制是相同的,但更便宜、更快。

我需要付费才能尝试吗? 注销发生在配音开始时,如果出现错误,代币会自动返还。