← すべての記事

1つのウィンドウで複数のAIに同時に音声通話:割り込みを入れて「Claude、GPT、DeepSeekに電話をかける」方法

1つのウィンドウで複数のAIに同時に音声通話:割り込みを入れて「Claude、GPT、DeepSeekに通話」する方法

主要なこと(BLUF)について簡単に説明します。

モデルの答えを一つ一つ比較するのは不便ですし、「ディクテーション」はまだ会話になっていません。 Claude、GPT、DeepSeek が同じウィンドウで応答する音声通話を行いました。電話とディクテーションの違い、アーキテクチャの仕組み、そしてどんな間違いを犯してしまったのかについて説明します。

AI とのほとんどのチャットでは、音声は次のようになります。メッセージを口述し、待って、答えを読みます。これは会話ではありません - これは口述です。私たちはいます ニューラルスペース セクションで行われた "チャット" 本格的な 音声通話: あなたが話すと、モデルがリアルタイムで音声で応答します。 割り込み、そしてあなたは電話することができます どのモデルでも - Claude、GPT、DeepSeek - 同じウィンドウ内。それがどのように機能するのか、そしてその理由を理解することは、思っているよりも難しいです。

なぜ「ディクテーション」≠会話なのか

ライブ会話は、プッシュツートーク インターフェイスにはない 2 つのことに依存します。

  1. 低遅延。 発言と回答の間に 3 ~ 4 秒の空白があると、対話の感覚が失われます。モデルはほぼすぐに応答を開始するはずです。
  2. 割り込み。 ライブスピーチでは、私たちは常に「やめて、そうではありません」、「要するに」、「…できますか?」とさえぎります。アシスタントがあなたの長い考えを終えて、あなたがすでに言ったことを無視した場合、これは対話者ではなく、留守番電話です。

どちらの点もストリームのアーキテクチャに関するものであり、「音声合成の接続」に関するものではありません。

建築

全二重パス: 連続入力、ナレーションへのトークンのストリーミング、中断時の応答の中断
全二重パス: 連続入力、ナレーションへのトークンのストリーミング、中断時の応答の中断

全二重パス。 マイクは継続的にストリーミングし、応答の再生と並行して認識が行われます。重要なポイント: 音声検出器がそれをキャッチするとすぐに モデルが応答している間にユーザーが話した、再生はすぐに停止し、暗黙の答えは遮断され、中断される前にモデルがなんとか言っていた内容が正しく文脈に組み込まれるため、モデルはどこで中断されたのかを理解することができます。

モデルに依存しない。 最も興味深いソリューションは、さまざまなモデルの上に単一の音声レイヤーを置くことです。ユーザーは 1 つのウィンドウで対話者を切り替えます。今彼は Claude と話しており、すぐに GPT と話し、次に DeepSeek と話しています。このために、声道 (認識 + 音声検出 + 中断ロジック + 合成) 特定のモデルから解放される: モデルは、共有音声インターフェイスの背後にある交換可能な「頭脳」です。このパスは「レプリカ → 応答トークン フロー → ボイスオーバー」という抽象的なフローで動作し、誰がその背後にいるのかはわかりません。

回答をナレーションにストリーミングします。 モデルが応答全体を完了するのを待たないように、トークンは生成されると文の境界に沿って分割されて合成されます。これにより遅延が少なくなり、中断が自然になります。すでに話された内容を正確に遮断します。

レーキ

  • 誤報の割り込み。 咳、周囲の騒音、「うーん」 - モデルは間違ったタイミングで話をやめました。本物のレプリカをノイズから区別するには、音声検出器のしきい値を調整する必要がありました。
  • 中断後のコンテキスト。 単に暗黙の答えを吐き出すと、モデルは答えたことをまったく「忘れて」しまいます。話された部分を対話のコースとして保存します。その後、「停止しますが、2 番目について詳しく」は意味のある働きをします。
  • ライブ会話でのモデルの切り替え。 対話の歴史は共通ですが、モデルの形式と「キャラクター」は異なります。私たちは歴史を正規化し、ゼロから始めるのではなく、新しいモデルが話題になるようにしています。

これはなぜですか

モデルが異なれば、さまざまな方法で強力になります。あるモデルは推論に優れ、別のモデルはより創造的で、別のモデルはおしゃべりが速くて安価です。切り替えを伴う音声通話では、これを自然なシナリオに変えます。つまり、1 人にアイデアについて話し合い、2 人目に批判を求め、3 人目に選択肢を与えるというものです。すべては 1 つのウィンドウで音声によって行われ、いつでも中断することができます。同じ声道が下にあります ウェブサイトの音声エージェント — そこでも彼はボタンを押します。

言語モデルに基づいて音声インターフェイスを構築している場合、バージインを解決し、中断された場合にコンテキストを保存する方法を議論するのは興味深いことです。電話してみてください: neuralspace.pro/チャット.

全二重パイプライン: 連続入力、音声へのトークンのストリーミング、中断時の再生カット
全二重パイプライン: 連続入力、音声へのトークンのストリーミング、中断時の再生カット

よくある質問(FAQ)

質問: ニューラル ネットワークから最良の結果を得るにはどうすればよいですか?
回答: 英語の詳細なプロンプト (説明) を使用し、シーンのスタイルと詳細を設定します。

質問: これらの素材は商業目的で使用できますか?
回答: はい、生成されたコンテンツは完全にあなたのものです。