互动头像:如何与头像进行实时直播对话
互动头像是「视频头像」板块里的直播会话:头像根据你的文本或上传的音频实时开口,结果立刻以直播链接返回。它和普通头像视频有本质区别:成片要渲染好几分钟,而直播会话几秒内就开始说话,而且你可以在直播过程中不断补充文本。下面讲清楚:这是什么工具、有哪几种模式、怎么开始会话、要花多少钱。
它是什么、适合谁
普通头像视频是「录制」:你设定文本、等待渲染、拿到成品文件。互动头像则像一场直播。会话一开,头像立刻开口,你实时操控它:补充新台词、停止或关闭。这个形式适合「时机很重要」的场景:落地页上欢迎访客、实时回答问题、简短演示、在正式录制前试脚本、会议或培训中的虚拟主持。
实时形式比普通生成快多少,看平台自己的实测:按 2026 年 9 月 7 日的遥测,5 秒 1080p 片段平均渲染约 115 秒,95% 的情况下不超过 165 秒。成品头像视频同样要在后台跑好几分钟——按平台 30 天(2026 年 9 月 3 日至 10 月 2 日)的生成日志,共启动 3,304 个视频任务,其中 2,377 个成功完成。而直播会话不受这份等待约束:它立刻开始。
三种语音来源
工具提供三种模式——按任务选择:
- 文本(Script)。输入现成文本,头像照读。适合问候、通知和事先备好的台词。
- 流式文本(Streaming text)。先给一句开场,再在会话过程中不断发送新句子——头像像在真实对话里一样继续说。适合答案边聊边想出来的场景。
- 音频(Audio)。上传现成音频文件,头像以精准口型复述(唇形同步)。当配音已经用你的声音或克隆声音录好时很合适。
「文本」和「流式文本」模式下的文本最多 5000 个字符。声音从带搜索和试听的库里选择:点声音旁的试听按钮,运行前先听一遍。

如何开始:分步操作
- 打开「视频头像」板块的「互动头像」标签页。
- 登录账号:访客可以浏览板块,但开始会话需要登录。
- 选择语音来源——「文本」「流式文本」或「音频」。
- 从现成头像库里挑一个形象。
- 文本类模式选好声音并输入台词——可以先试听声音。
- 「音频」模式附上音频文件。
- 查看 token 价格——运行前显示,按会话时长计算。
- 点「开始会话」。头像开始说话,会话出现在历史里。
如何管理会话
直播会话是流而不是文件,所以在历史里有独立状态:「直播中」「已结束」或「错误」。结束的会话可以通过直播链接打开,并在卡片里用内置播放器直接观看。在「流式文本」模式下,只要会话还在进行,就会出现发送新台词的输入框——对话无需重开即可继续。任何会话都能一键停止并从历史中删除。
要花多少钱
按会话秒数计费,最小计费块为一分钟。token 价格在运行前显示,并按与扣费相同的数据计算,所以对任何允许的输入,显示金额都等于实际扣费。会话失败时已扣费用退回。没有订阅:新用户会获得用于首次尝试的初始 token,之后按需充值。
搭配使用
常见问题
互动头像和普通头像视频有什么区别?
普通视频是录制:文本事先设定,然后渲染,最终得到成品文件。直播会话是流:头像立刻开口,你可以在直播中继续发送文本。前者用于成品视频,后者用于对话和即时回答。
需要一直开着标签页吗?
会话在服务端运行,结果通过直播链接可访问——你可以从历史回到它。「流式文本」模式下补充台词,开着标签页更方便。
有哪些声音和语言?
声音来自可按语言筛选的库:运行前可以搜索和试听。声音语言与模式分开选择——可以用需要语言来朗读文本。
一次会话多少钱?
按秒计费,最小计费块为一分钟;token 价格在运行前显示并等于实际扣费。没有订阅,新用户会获得初始 token。