← すべての記事

実際にサイトを制御する音声オーブ: 「話す FAQ」ではなく、アシスタントのアーキテクチャ

実際にサイトを制御する音声オーブ: 「話す FAQ」ではなく、アシスタントのアーキテクチャ

主要なこと(BLUF)について簡単に説明します。

Web サイト上の会話ウィジェットはアシスタントではなく、おもちゃです。会話はしますが、何もしません。私たちの voice orb が実際にサイトを運営しています。内部には 3 層のアーキテクチャ、私たちが踏んだ 3 つの熊手、対話の経済、そして Web サイトに同じオーブを配置する方法があります。

Web サイト上の音声アシスタントは通常、音声認識を備えたチャットボットか、FAQ のナレーションのいずれかになります。私たちはいます NeuralSpace 逆のタスクから出発しました - 声を出す インターフェースを管理する主な方法、テキスト上の上部構造ではありません。以下は、アーキテクチャと下すべき決定の分析です。

タスク

ユーザーは複雑な生成ページを開きます- ビデオ, 写真, 音楽 — モデルの選択、参照、リクエスト、パラメータのロードがあります。新人は失われます。ユーザーは 2 番目のステップで従来のオンボーディング (矢印のあるツアー) を終了します。私たちはそれを簡単にできるようにしたかったのです 声で言う:「この写真に命を吹き込みたいです」とアシスタント自身が希望のボタンを強調表示し、説明し、結果をもたらしました。

チャットボットとの主な違い: orb ページの状態を確認します そして 彼女に働きかける「どこかの X ボタンを押してください」というテキストで応答するのではなく、

アーキテクチャ: 3 層

3 つのレイヤー: 声道、機械可読ページ スナップショットを備えた脳、DOM 上の実行プログラム
3 つのレイヤー: 声道、機械可読ページ スナップショットを備えた脳、DOM 上の実行プログラム
  1. 声道。 ストリーミング音声認識→モデル→応答合成。要件は低遅延とその能力です。 割り込み (バージイン): ユーザーが話し始めると、アシスタントは沈黙します。これがないと、対話というよりはトランシーバーのように感じられます。
  2. 脳。 私たちはアシスタントの「個性」を特定の言語モデルから意図的に切り離しました。モデルはサーバー側で構成されるため、フロントエンドを再開発することなく、タスクとコストに合わせて変更できます。アシスタントはユーザーの応答を受け取るだけでなく、 現在のページの機械可読スナップショット: どのような要素があり、どのようなボタンがあり、何がすでに選択されているか。
  3. クライアント上のエグゼキュータ。 モデルはテキストだけでなく、 アクション: 要素をハイライトし、ブロックまでスクロールし、説明フィールドを表示します。クライアントは実際の DOM 上でそれらを実行します。

私たちが踏んだ3つの熊手

最も興味深いのは、幸せな道ではなく、失敗です。実際の対話のログを分析し、根本的なルールを導き出しました。

1. 可能性の幻覚。 アシスタントは、現在のページにないモデルを提案したり、写真のモデルとビデオのモデルを混同したりしました。ユーザーが「そのようなモデルはない」と怒るのは当然です。修正 - モデルの「世界の知識」に依存しないでください。アシスタントは名前を付けて切り替えることができます。 現在のページのスナップショットに実際にあるもののみ。これは古典的な接地の問題です。モデルはインターフェイスの状態に厳密に関連付けられている必要があります。そうでない場合、モデルは自信を持って嘘をつきます。

2. 間違ったボタンが点灯します。 「写真をアップロードする」を表示するように求められます - 「生成」が強調表示されます。その理由は、「意図 → 要素」のマッピングがあいまいであることです。解決策: 要素はセマンティック アンカーを受け取り、アシスタントは強調表示する必要があります。 まさにそれ、彼はそれについて話していますが、意味的には隣接していません。

3. 執着心。 モデルはすでに選択されています - アシスタントはまだモデルを変更しようとしています。ユーザーは「リクエストを書いてください」と尋ねますが、彼は反論します。ルール: 状態がすでに適切である場合、またはユーザーが明示的にタッチしないように要求した場合 - 行動したり議論したりしないでください、言われたことをすぐに実行します。主導権が減り、実行力が高まります。

インターフェイス上にエージェントを構築する人に与える結論は次のとおりです。 品質の 90% はモデルではなく、行動の根拠と規律です。モデルは正確な状態を認識する必要があり、それを超えることは許可されません。

対話の経済学

音声はテキストよりも高価であるため、Orb には無料期間があり、会話時に支払いが行われます。請求は、「メッセージ」の数ではなく、音声対話の継続時間に関連付けられます。

同じオーブがあなたのウェブサイトにあります

私たちは Orb を自分たち用にカスタマイズしましたが、そのタスクは普遍的です。単純ではないインターフェイス (コンフィギュレーター、個人アカウント、複雑なフォーム、フィルター付きストア) を備えたサイトであれば、ページを確認して操作する音声ガイドの恩恵を受けることができます。したがって、これを埋め込みウィジェットに組み込みます。インストール方法と何ができるかについては、別途説明します。 あらゆるWebサイトの音声エージェント.

同様のことを行っている場合は、グラウンディングとバージインのアプローチを比較すると興味深いでしょう。 Orb ライブを試すことができます ニューラルスペースプロ.

3 つのレイヤー: 音声パイプライン、機械可読ページ スナップショットを備えた頭脳、DOM 上のクライアント エグゼキューター
3 つのレイヤー: 音声パイプライン、機械可読ページ スナップショットを備えた頭脳、DOM 上のクライアント エグゼキューター

よくある質問(FAQ)

質問: ニューラル ネットワークから最良の結果を得るにはどうすればよいですか?
回答: 英語の詳細なプロンプト (説明) を使用し、シーンのスタイルと詳細を設定します。

質問: これらの素材は商業目的で使用できますか?
回答: はい、生成されたコンテンツは完全にあなたのものです。