← Tutti gli articoli

Chiamata vocale a più IA contemporaneamente in una finestra: come effettuare "chiamata Claude, GPT e DeepSeek" con interruzione

Chiamata vocale a più IA contemporaneamente in un'unica finestra: come effettuare "chiamata Claude, GPT e DeepSeek" con interruzione

Brevemente sulla cosa principale (BLUF)

È scomodo confrontare le risposte dei modelli una per una e la “dettatura” non è ancora una conversazione. Abbiamo effettuato una chiamata vocale in cui Claude, GPT e DeepSeek rispondono nella stessa finestra. Ti diremo in cosa differisce una chiamata da un dettato, come funziona l'architettura e quali errori hai commesso.

Nella maggior parte delle chat con AI, la voce si presenta così: detti un messaggio, aspetti, leggi la risposta. Questa non è una conversazione: è un dettato. Siamo dentro Spazio neurale fatto nella sezione "Chiacchierata" a pieno titolo chiamata vocale: tu parli, la modella risponde con una voce in tempo reale, tu puoi interrompere, e puoi chiamare qualsiasi modello - Claude, GPT, DeepSeek - nella stessa finestra. Capire come funziona e perché è più difficile di quanto sembri.

Perché “dettatura” ≠ conversazione

Una conversazione dal vivo si basa su due cose che le interfacce push-to-talk non hanno:

  1. Bassa latenza. Una pausa di 3-4 secondi tra la tua osservazione e la risposta uccide la sensazione del dialogo. Il modello dovrebbe iniziare a rispondere quasi immediatamente.
  2. Irrompere. Nel discorso dal vivo interrompiamo costantemente: “basta, non è questo”, “in breve”, “puoi…”. Se un assistente termina il suo lungo pensiero, ignorando quello che stai già dicendo, questo non è un interlocutore, è una segreteria telefonica.

Entrambi i punti riguardano l’architettura dei flussi e non la “connessione della sintesi vocale”.

Architettura

Percorso full-duplex: input continuo, streaming di token nella voce fuori campo, interruzione della risposta in caso di interruzione
Percorso full-duplex: input continuo, streaming di token nella voce fuori campo, interruzione della risposta in caso di interruzione

Percorso full duplex. Il microfono trasmette continuamente, il riconoscimento avviene parallelamente alla riproduzione della risposta. Punto chiave: non appena il rilevatore vocale lo rileva l'utente ha parlato mentre il modello rispondeva, la riproduzione si interrompe immediatamente, la risposta non detta viene interrotta e ciò che la modella è riuscita a dire prima dell'interruzione viene contestualizzato correttamente, in modo che capisca dove è stata interrotta.

Agnostico rispetto al modello. La soluzione più interessante è un singolo livello vocale sopra diversi modelli. L'utente cambia interlocutore in una finestra: ora parla con Claude, tra un minuto - con GPT, poi con DeepSeek. Per questo, il tratto vocale (riconoscimento + rilevamento del parlato + logica di interruzione + sintesi) slegato da un modello specifico: Il modello è il “cervello” sostituibile dietro l’interfaccia vocale condivisa. Il percorso funziona con il flusso astratto “replica → flusso token di risposta → voce fuori campo” e non sa chi c’è dietro.

Streaming della risposta nella voce fuori campo. Per non aspettare che il modello completi l'intera risposta, i token entrano in sintesi man mano che vengono generati, in blocchi lungo i confini delle frasi. Questo dà un ritardo basso e rende naturale l'interruzione: interrompiamo esattamente ciò che è già stato detto.

Rastrello

  • Irruzione di falsi allarmi. Tosse, rumore di fondo, "uh-huh": la modella smette di parlare nel momento sbagliato. Abbiamo dovuto calibrare la soglia del rilevatore vocale per distinguere la replica reale dal rumore.
  • Contesto dopo l'interruzione. Se semplicemente lanci una risposta non detta, il modello “dimentica” di aver risposto. Salviamo la parte parlata come il suo corso nel dialogo - quindi "fermati, ma di più sul secondo" funziona in modo significativo.
  • Cambiare il modello in una conversazione dal vivo. La storia del dialogo è comune, ma i modelli hanno formati e “caratteri” diversi. Stiamo normalizzando la storia in modo che il nuovo modello riprenda la conversazione anziché partire da zero.

Perché è questo?

Modelli diversi sono forti in modi diversi: uno è più bravo a ragionare, un altro è più creativo, un altro è più veloce ed economico per le chiacchiere. Una chiamata vocale con commutazione trasforma questo in uno scenario naturale: si discute l'idea con uno, si chiede al secondo di criticare e al terzo di fornire opzioni. Tutto avviene a voce, in un'unica finestra, con la possibilità di interrompere in qualsiasi momento. Sotto si trova lo stesso tratto vocale agente vocale per siti web – lì preme anche i pulsanti.

Se stai costruendo interfacce vocali su modelli linguistici, è interessante discutere su come risolvere l'intervento e salvare il contesto in caso di interruzione. Prova a chiamare: neuralspace.pro/chat.

Pipeline full-duplex: input continuo, token trasmessi in parlato, riproduzione interrotta in caso di interruzione
Pipeline full-duplex: input continuo, token trasmessi in parlato, riproduzione interrotta in caso di interruzione

Domande frequenti (FAQ)

Domanda: Come ottenere il miglior risultato da una rete neurale?
Risposta: utilizzare istruzioni dettagliate (descrizioni) in inglese, impostare lo stile e i dettagli della scena.

Domanda: questi materiali possono essere utilizzati per scopi commerciali?
Risposta: Sì, il contenuto generato è interamente tuo.