← Все статьи

Hlasové volání několika AI najednou v jednom okně: jak provést „volání Claude, GPT a DeepSeek“ s přerušením

Hlasové volání několika AI najednou v jednom okně: jak provést „volání Claude, GPT a DeepSeek“ s přerušením

Krátce o hlavní věci (BLUF)

Porovnávat odpovědi modelů jednu po druhé je nepohodlné a „diktát“ ještě není konverzace. Uskutečnili jsme hlasový hovor, kde Claude, GPT a DeepSeek odpověděli ve stejném okně. Řekneme vám, jak se hovor liší od diktátu, jak funguje architektura a jaké chyby jste udělali.

Ve většině chatů s AI vypadá hlas takto: nadiktujete zprávu, počkáte, přečtete si odpověď. Toto není konverzace - to je diktát. jsme vNeuralSpaceprovedeno v sekci"Povídání"plnohodnotnýhlasový hovor: mluvíte, model odpoví hlasem v reálném čase, můžetepřerušita můžete zavolatjakýkoli model- Claude, GPT, DeepSeek - ve stejném okně. Pochopit, jak to funguje a proč, je těžší, než se zdá.

Proč „diktát“ ≠ konverzace

Živá konverzace se opírá o dvě věci, které rozhraní push-to-talk nemají:

  1. Nízká latence.Pauza 3-4 sekund mezi vaší poznámkou a odpovědí zabíjí pocit dialogu. Model by měl začít reagovat téměř okamžitě.
  2. Vplutí.V živé řeči neustále přerušujeme: „přestaň, to není ono“, „zkrátka“, „můžeš…“. Pokud asistent dokončí svou dlouhou myšlenku a ignoruje to, co již říkáte, toto není účastník rozhovoru, je to záznamník.

Oba body se týkají architektury proudů, nikoli „propojování syntézy řeči“.

Architektura

Full-duplex path: continuous input, streaming of tokens into voice-over, interruption of response when interrupting
Plně duplexní cesta: nepřetržitý vstup, streamování tokenů do voice-overu, přerušení odezvy při přerušení

Plně duplexní cesta.Mikrofon proudí nepřetržitě, rozpoznávání probíhá paralelně s přehráváním odpovědi. Klíčový bod: jakmile to zachytí detektor řečiuživatel mluvil, zatímco model odpovídal, přehrávání se okamžitě zastaví, nevyřčená odpověď se odstřihne a to, co stihla modelka říct před přerušením, se správně zasadí do kontextu - aby pochopila, kde byla vyrušena.

Model agnostik.Nejzajímavějším řešením je jediná hlasová vrstva nad různými modely. Uživatel přepne partnera v jednom okně: nyní mluví s Claudem, za minutu - s GPT, poté s DeepSeek. K tomu slouží vokální trakt (rozpoznávání + detekce řeči + logika přerušení + syntéza)vyvázané z konkrétního modelu: Model je vyměnitelný „mozek“ za sdíleným hlasovým rozhraním. Cesta pracuje s abstraktním tokem „replica → response token flow → voiceover“ a neví, kdo za tím stojí.

Streamování odpovědi do hlasového komentáře.Aby se nečekalo, až model dokončí celou odpověď, přecházejí tokeny do syntézy tak, jak jsou generovány, po kouscích podél hranic vět. To poskytuje malé zpoždění a přerušování je přirozené: odřízneme přesně to, co již bylo řečeno.

Hrábě

  • Falešný poplach.Kašel, hluk v pozadí, „uh-huh“ – modelka přestane mluvit ve špatnou dobu. Museli jsme zkalibrovat práh detektoru řeči, abychom odlišili skutečnou repliku od šumu.
  • Kontext po přerušení.Pokud jednoduše vyhodíte nevyslovenou odpověď, model „zapomene“, že vůbec odpověděl. Mluvenou část uložíme jako její průběh v dialogu - pak smysluplně funguje „stop, ale více o dvojce“.
  • Přepínání modelu v živé konverzaci.Historie dialogu je společná, ale modely mají různé formáty a „postavy“. Normalizujeme historii, aby nový model navázal konverzaci a nezačínal od nuly.

Proč tomu tak je?

Různé modely jsou silné různými způsoby: jeden je lepší v uvažování, jiný je kreativnější, jiný je rychlejší a levnější na tlachání. Hlasový hovor s přepínáním z toho udělá přirozený scénář: prodiskutovali nápad s jedním, druhého požádali, aby kritizoval, a třetího, aby dal možnosti. Vše se děje hlasem, v jednom okně, s možností kdykoliv přerušit. Stejný vokální trakt leží podhlasový agent pro webové stránky— tam také mačká tlačítka.

Pokud stavíte hlasová rozhraní na jazykových modelech, je zajímavé diskutovat o tom, jak řešíte vkládání a ukládání kontextu, když je porušeno. Zkuste zavolat:neuralspace.pro/chat.

Full-duplex pipeline: continuous input, tokens streamed into speech, playback cut on interruption
Plně duplexní kanál: kontinuální vstup, tokeny streamované do řeči, přehrávání přerušeno

Často kladené otázky (FAQ)

Otázka: Jak získat nejlepší výsledek z neuronové sítě?
Odpověď: Použijte podrobné výzvy (popisy) v angličtině, nastavte styl a detaily scény.

Otázka: Mohou být tyto materiály použity pro komerční účely?
Odpověď: Ano, vygenerovaný obsah je zcela váš.