← 所有文章

实际控制站点的语音球:助手的架构,而不是“会说话的常见问题解答”

实际控制站点的语音球:助手的架构,而不是“会说话的常见问题解答”

简单说一下主要的事情(BLUF)

网站上的会说话的小部件不是助手,而是玩具:它会说话,但不执行任何操作。我们的声音球真正运行着这个网站。里面有三层架构,我们踩过的三个耙子,对话的经济性以及将相同的球体放在您的网站上的方法。

网站上的语音助手通常以两种方式之一结束:要么是带有语音识别功能的聊天机器人,要么是常见问题解答画外音。我们在 NeuralSpace 从相反的任务开始——发出声音 管理接口的主要方式,而不是文本的上层建筑。以下是对架构和必须做出的决策的分析。

任务

用户打开一个复杂的生成页面 - 视频, 图片, 音乐 — 可以选择模型、加载参考、请求、参数。新人迷失了。人们在第二步关闭经典的入门(带箭头的游览)。我们希望能够简单地 用声音说:“我想让这张照片栩栩如生”,助手本人突出显示了所需的按钮,进行了解释并得出了结果。

与聊天机器人的主要区别:orb 查看页面状态对她起作用,而不是回复文本“按某处的 X 按钮”。

架构:三层

三层:声道、具有机器可读页面快照的大脑、DOM 之上的执行器
三层:声道、具有机器可读页面快照的大脑、DOM 之上的执行器
  1. 声带。 流式语音识别→模型→响应合成。要求是低延迟和能力 打断 (打断):用户开始讲话 - 助理陷入沉默。如果没有这个,对话感觉就像对讲机而不是对话。
  2. 脑。 我们特意将助手的“个性”与特定的语言模型解耦:该模型是在服务器端配置的,因此可以更改它以适应任务和成本,而无需重新开发前端。助手不仅接收用户的响应,还接收 当前页面的机器可读快照:有哪些元素、哪些按钮、已选择哪些内容。
  3. 客户端上的执行者。 该模型不仅返回文本,还返回 行动:突出显示元素,滚动到块,解释字段。客户端在真实 DOM 之上执行它们。

我们踩过的三把耙子

最有趣的不是幸福的道路,而是失败的道路。我们分析了真实对话的日志并提出了根本规则。

1.可能性的幻觉。 助理推荐了当前页面上没有的模特,或者将图片模特与视频模特混淆了。用户愤怒是有道理的:“没有这样的模型。”修复 - 不要依赖模型的“世界知识”:助手可以命名和切换 仅当前页面快照中实际存在的内容。这是一个经典的基础问题——模型必须严格绑定到接口的状态,否则它就会自信地撒谎。

2. 错误的按钮亮起。 他们要求您显示“上传照片”-“生成”突出显示。原因是“意图→元素”映射模糊。解决方案:元素接收语义锚点,助手必须突出显示 正是那个,他所说的,并且在含义上并不相邻。

3. 强迫症。 型号已经选定 - 助手仍在尝试更改它;用户询问“只需写一个请求”——他争辩道。规则:如果状态已经合适或者用户明确要求不要触摸 - 不采取行动或争论,立即按照要求去做。少一点主动性,多一点执行力。

对于任何在接口之上构建代理的人,我们给出的结论是: 90%的品质不是模型,而是行动的根基和纪律。模型必须看到准确的状态并且不允许超越它。

对话经济学

语音比文字贵,所以Orb有一个免费窗口,然后通过对话付款。计费与语音交互的持续时间相关,而不是“消息”的数量。

您的网站上有相同的球体

我们为自己定制了球体,但任务是通用的:任何具有重要界面(配置器、个人帐户、复杂表单、带过滤器的存储)的站点都受益于查看页面并对其进行操作的语音指南。因此,我们将它放入一个嵌入式小部件中——它是如何安装的以及它能做什么单独讨论: 适用于任何网站的语音代理.

如果您正在做类似的事情,比较接地和打断的方法会很有趣。您可以尝试 orb live 神经空间专业版.

三层:语音管道、具有机器可读页面快照的大脑、DOM 上的客户端执行器
三层:语音管道、具有机器可读页面快照的大脑、DOM 上的客户端执行器

常见问题 (FAQ)

问题:如何从神经网络中获得最佳结果?
答:使用详细的英文提示(描述),设置场景的风格和细节。

问:这些材料可以用于商业用途吗?
答:是的,生成的内容完全属于您。