在一个窗口中同时语音呼叫多个AI:如何中断地“呼叫Claude、GPT和DeepSeek”
简单说一下主要的事情(BLUF)
模型的答案不方便一一比较,“听写”还不是对话。我们进行了语音通话,Claude、GPT 和 DeepSeek 在同一窗口中接听。我们将告诉您调用与听写有何不同、架构如何工作以及您犯了哪些错误。
在大多数与人工智能的聊天中,语音看起来是这样的:你口述一条消息,等待,读出答案。这不是对话——这是听写。我们在 神经空间 在该部分完成 “聊天” 成熟的 语音通话:你说话,模型实时语音回应,你可以 打断,你可以打电话 任何型号 - Claude、GPT、DeepSeek - 在同一窗口中。了解它是如何工作的以及为什么比看起来更困难。
为什么“听写”≠对话
实时对话依赖于一键通界面所不具备的两件事:
- 低延迟。 在你的评论和答案之间停顿 3-4 秒会破坏对话的感觉。模型应该几乎立即开始响应。
- 打断。 在现场演讲中,我们不断打断:“停下来,不是这样的”、“总之”、“你能……”。如果一个助手完成了他漫长的思考,而忽略了你已经在说什么,那么这不是一个对话者,这是一个答录机。
这两点都是关于流的架构,而不是关于“连接语音合成”。
建筑学

全双工路径。 麦克风连续不断地流动,识别与回放答案同时发生。关键点:一旦语音检测器捕捉到这一点 用户在模型响应时说话,播放立即停止,未说出的答案被切断,并且模型在中断之前设法说出的内容被正确地放入上下文中 - 以便她了解她在哪里被打断。
模型不可知。 最有趣的解决方案是不同模型之上的单个语音层。用户在一个窗口中切换对话者:现在他正在与 Claude 交谈,一分钟后 - 与 GPT 交谈,然后与 DeepSeek 交谈。为此,声道(识别+语音检测+中断逻辑+合成) 从特定模型中解脱出来:模型是共享语音界面背后的可更换“大脑”。该路径采用抽象流程“副本→响应令牌流程→配音”,并且不知道背后是谁。
将答案串流到画外音中。 为了不等待模型完成整个答案,标记在生成时会沿着句子边界以块的形式进行合成。这提供了较低的延迟并使打断变得自然:我们准确地切断了已经说过的内容。
耙
- 误报闯入。 咳嗽、背景噪音、“嗯嗯”——模特在错误的时间停止说话。我们必须校准语音检测器的阈值,以区分真实的复制品和噪声。
- 中断后的上下文。 如果你只是简单地抛出一个不言而喻的答案,模型就会“忘记”它的答案。我们将口语部分保存为对话中的进程——然后“停下来,但更多地关注第二个”就有意义了。
- 在实时对话中切换模型。 对话的历史是共同的,但模型有不同的格式和“字符”。我们正在使历史正常化,以便新模型能够接续对话,而不是从头开始。
这是为什么
不同的模型在不同方面都有优势:一种模型更擅长推理,另一种模型更具创造性,另一种模型则速度更快、成本更低。带切换功能的语音通话将这变成了一种自然的场景:与一个人讨论这个想法,要求第二个人批评,然后第三个人给出选择。一切都通过语音在一个窗口中完成,并且可以随时中断。相同的声道位于 网站语音代理 ——他也在那里按下按钮。
如果您要在语言模型之上构建语音界面,那么讨论如何解决插入问题以及在中断时保存上下文会很有趣。尝试致电: 神经空间.pro/聊天.

常见问题 (FAQ)
问题:如何从神经网络中获得最佳结果?
答:使用详细的英文提示(描述),设置场景的风格和细节。
问:这些材料可以用于商业用途吗?
答:是的,生成的内容完全属于您。