← Tous les articles

Appel vocal vers plusieurs IA à la fois dans une seule fenêtre : comment faire des « appels Claude, GPT et DeepSeek » avec interruption

Appel vocal vers plusieurs IA à la fois dans une seule fenêtre : comment faire des « appels Claude, GPT et DeepSeek » avec interruption

En bref sur l'essentiel (BLUF)

Il n'est pas pratique de comparer les réponses des modèles une par une, et la « dictée » n'est pas encore une conversation. Nous avons passé un appel vocal où Claude, GPT et DeepSeek répondent dans la même fenêtre. Nous vous expliquerons en quoi un appel diffère d'une dictée, comment fonctionne l'architecture et quelles erreurs vous avez commises.

Dans la plupart des discussions avec l'IA, la voix ressemble à ceci : vous dictez un message, attendez, lisez la réponse. Ce n’est pas une conversation, c’est une dictée. Nous sommes dans Espace neuronal fait dans la section "Chat" à part entière appel vocal: vous parlez, le modèle répond par une voix en temps réel, vous pouvez interrompre, et tu peux appeler n'importe quel modèle - Claude, GPT, DeepSeek - dans la même fenêtre. Comprendre comment cela fonctionne et pourquoi est plus difficile qu’il n’y paraît.

Pourquoi « dictée » ≠ conversation

Une conversation en direct repose sur deux éléments que les interfaces push-to-talk n'ont pas :

  1. Faible latence. Une pause de 3 à 4 secondes entre votre remarque et la réponse tue la sensation de dialogue. Le modèle devrait commencer à répondre presque immédiatement.
  2. Faire irruption. En direct, on interrompt constamment : « arrête, c'est pas ça », « bref », « tu peux… ». Si un assistant termine sa longue réflexion en ignorant ce que vous dites déjà, ce n'est pas un interlocuteur, c'est un répondeur.

Les deux points concernent l’architecture des flux, et non la « synthèse vocale connectée ».

Architecture

Chemin duplex intégral : saisie continue, streaming des jetons en voix off, interruption de la réponse en cas d'interruption
Chemin duplex intégral : saisie continue, streaming des jetons en voix off, interruption de la réponse en cas d'interruption

Chemin duplex intégral. Le microphone diffuse en continu, la reconnaissance s'effectue parallèlement à la lecture de la réponse. Point clé : dès que le détecteur de parole détecte cela l'utilisateur a parlé pendant que le modèle répondait, la lecture s'arrête immédiatement, la réponse tacite est coupée et ce que le modèle a réussi à dire avant l'interruption est correctement mis en contexte - afin qu'elle comprenne où elle a été interrompue.

Indépendant du modèle. La solution la plus intéressante est une seule couche vocale au-dessus de différents modèles. L'utilisateur change d'interlocuteur dans une fenêtre : maintenant il parle avec Claude, dans une minute - avec GPT, puis avec DeepSeek. Pour cela, le conduit vocal (reconnaissance + détection de parole + logique d'interruption + synthèse) délié d'un modèle spécifique: Le modèle est le « cerveau » remplaçable derrière l’interface vocale partagée. Le chemin fonctionne avec le flux abstrait « réplique → flux de jetons de réponse → voix off » et ne sait pas qui se cache derrière.

Diffusion de la réponse en voix off. Afin de ne pas attendre que le modèle complète la réponse complète, les jetons entrent en synthèse au fur et à mesure de leur génération, en morceaux le long des limites des phrases. Cela donne un faible délai et rend les interruptions naturelles : on coupe exactement ce qui a déjà été dit.

Râteau

  • Intervention par fausse alarme. Toux, bruit de fond, « uh-huh » - le modèle arrête de parler au mauvais moment. Nous avons dû calibrer le seuil du détecteur de parole pour distinguer la réplique réelle du bruit.
  • Contexte après interruption. Si vous lancez simplement une réponse tacite, le modèle « oublie » qu’il a répondu. Nous sauvegardons la partie parlée comme son déroulement dans le dialogue - puis « arrêtons, mais parlons davantage de la seconde » fonctionne de manière significative.
  • Changer de modèle dans une conversation en direct. L'histoire du dialogue est commune, mais les modèles ont des formats et des « personnages » différents. Nous normalisons l'histoire afin que le nouveau modèle reprenne la conversation plutôt que de repartir de zéro.

Pourquoi est-ce

Différents modèles sont forts de différentes manières : l’un est meilleur en raisonnement, un autre est plus créatif, un autre est plus rapide et moins coûteux en bavardage. Un appel vocal avec commutation transforme cela en un scénario naturel : discutez de l'idée avec l'un, demandez au deuxième de critiquer et au troisième de proposer des options. Tout se fait vocalement, dans une seule fenêtre, avec la possibilité d'interrompre à tout moment. Le même conduit vocal se trouve sous agent vocal pour sites Web — là, il appuie aussi sur des boutons.

Si vous créez des interfaces vocales au-dessus de modèles de langage, il est intéressant de discuter de la façon dont vous résolvez les intrusions et enregistrez le contexte en cas de rupture. Essayez d'appeler : neuralspace.pro/chat.

Pipeline full-duplex : entrée continue, jetons diffusés dans la parole, lecture coupée en cas d'interruption
Pipeline full-duplex : entrée continue, jetons diffusés dans la parole, lecture coupée en cas d'interruption

Questions fréquemment posées (FAQ)

Question : Comment obtenir le meilleur résultat d’un réseau de neurones ?
Réponse : Utilisez des invites détaillées (descriptions) en anglais, définissez le style et les détails de la scène.

Question : Ces matériaux peuvent-ils être utilisés à des fins commerciales ?
Réponse : Oui, le contenu généré vous appartient entièrement.