← Все статьи

Hlasový hovor s niekoľkými AI naraz v jednom okne: ako „zavolať Claude, GPT a DeepSeek“ s prerušením

Hlasový hovor s niekoľkými AI naraz v jednom okne: ako „zavolať Claude, GPT a DeepSeek“ s prerušením

Stručne o hlavnej veci (BLUF)

Je nepohodlné porovnávať odpovede modelov jednu po druhej a „diktát“ ešte nie je rozhovor. Uskutočnili sme hlasový hovor, kde Claude, GPT a DeepSeek odpovedali v rovnakom okne. Povieme vám, ako sa hovor líši od diktátu, ako funguje architektúra a aké chyby ste urobili.

Vo väčšine rozhovorov s AI vyzerá hlas takto: nadiktujete správu, počkáte, prečítate si odpoveď. Toto nie je rozhovor - toto je diktát. sme vNeuralSpacevykonané v sekcii"rozhovor"plnohodnotnéhlasový hovor: hovoríte, model odpovedá hlasom v reálnom čase, môžeteprerušiťa môžete zavolaťakýkoľvek model- Claude, GPT, DeepSeek - v tom istom okne. Pochopiť, ako to funguje a prečo, je ťažšie, ako sa zdá.

Prečo „diktát“ ≠ rozhovor

Živá konverzácia sa spolieha na dve veci, ktoré rozhrania push-to-talk nemajú:

  1. Nízka latencia.Pauza 3-4 sekúnd medzi vašou poznámkou a odpoveďou zabíja pocit dialógu. Model by mal začať reagovať takmer okamžite.
  2. Nalodenie.V živej reči neustále prerušujeme: „prestaň, to nie“, „skrátka“, „môžeš...“. Ak asistent dokončí svoju dlhú myšlienku a ignoruje to, čo už hovoríte, toto nie je hovorca, toto je záznamník.

Oba body sa týkajú architektúry prúdov a nie „prepájania syntézy reči“.

Architektúra

Full-duplex path: continuous input, streaming of tokens into voice-over, interruption of response when interrupting
Plne duplexná cesta: nepretržitý vstup, streamovanie tokenov do hlasového prenosu, prerušenie odozvy pri prerušení

Plne duplexná cesta.Mikrofón prúdi nepretržite, rozpoznávanie prebieha súbežne s prehrávaním odpovede. Kľúčový bod: hneď ako to zachytí detektor rečipoužívateľ hovoril, kým model odpovedal, prehrávanie sa okamžite zastaví, nevyslovená odpoveď sa preruší a to, čo stihla modelka povedať pred prerušením, sa správne zasadí do kontextu - aby pochopila, kde bola prerušená.

Modelový agnostik.Najzaujímavejším riešením je jedna hlasová vrstva nad rôznymi modelmi. Používateľ prepne partnera v jednom okne: teraz hovorí s Claudom, za minútu - s GPT, potom s DeepSeek. Na tento účel hlasový trakt (rozpoznávanie + detekcia reči + logika prerušenia + syntéza)odviazané od konkrétneho modelu: Model je vymeniteľný „mozog“ za zdieľaným hlasovým rozhraním. Cesta pracuje s abstraktným tokom „replica → response token flow → voiceover“ a nevie, kto je za tým.

Streamovanie odpovede do hlasového prejavu.Aby sa nečakalo, kým model dokončí celú odpoveď, tokeny prechádzajú do syntézy, keď sú generované, v kúskoch pozdĺž hraníc viet. To poskytuje nízke oneskorenie a prerušenie je prirodzené: prerušíme presne to, čo už bolo povedané.

Hrable

  • Vstup na falošný poplach.Kašeľ, hluk v pozadí, „uh-huh“ - model prestane hovoriť v nesprávnom čase. Museli sme kalibrovať prah detektora reči, aby sme rozlíšili skutočnú repliku od šumu.
  • Kontext po prerušení.Ak jednoducho vyhodíte nevyslovenú odpoveď, model „zabudne“, že vôbec odpovedal. Hovorenú časť uložíme ako jej priebeh v dialógu – potom „prestaň, ale viac o dvojke“ funguje zmysluplne.
  • Prepínanie modelu v živom rozhovore.História dialógu je bežná, ale modely majú rôzne formáty a „postavy“. Normalizujeme históriu, aby nový model nadviazal konverzáciu a nezačínal od nuly.

Prečo je to tak?

Rôzne modely sú silné v rôznych smeroch: jeden je lepší v uvažovaní, iný je kreatívnejší, iný je rýchlejší a lacnejší na chatovanie. Hlasový hovor s prepínaním z toho robí prirodzený scenár: s jedným sa o nápade porozprávali, druhého požiadali, aby ho kritizoval, a tretieho, aby dal možnosti. Všetko prebieha hlasom, v jednom okne, s možnosťou kedykoľvek prerušiť. Ten istý vokálny trakt leží podhlasový agent pre webové stránky— tam stláča aj gombíky.

Ak staviate hlasové rozhrania na jazykových modeloch, je zaujímavé diskutovať o tom, ako vyriešite vplávanie a ukladanie kontextu, keď je rozbité. Skúste zavolať:neuralspace.pro/chat.

Full-duplex pipeline: continuous input, tokens streamed into speech, playback cut on interruption
Plne duplexný kanál: nepretržitý vstup, tokeny streamované do reči, prehrávanie prerušené pri prerušení

Často kladené otázky (FAQ)

Otázka: Ako získať najlepší výsledok z neurónovej siete?
Odpoveď: Použite podrobné výzvy (popisy) v angličtine, nastavte štýl a detaily scény.

Otázka: Môžu byť tieto materiály použité na komerčné účely?
Odpoveď: Áno, vygenerovaný obsah je výlučne váš.