← Összes cikk

Hanghívás egyszerre több mesterséges intelligencia számára egy ablakban: hogyan lehet „Claude, GPT és DeepSeek hívása” megszakítással

Hanghívás egyszerre több mesterséges intelligencia számára egy ablakban: hogyan lehet „Claude, GPT és DeepSeek hívása” megszakítással

Röviden a legfontosabbról (BLUF)

Kényelmetlen a modellek válaszait egyenként összehasonlítani, a „diktálás” pedig még nem beszélgetés. Hanghívást kezdeményeztünk, ahol Claude, GPT és DeepSeek válaszol ugyanabban az ablakban. Elmondjuk, miben különbözik a hívás a diktálástól, hogyan működik az architektúra, és milyen hibákat követett el.

A legtöbb mesterséges intelligenciával folytatott csevegésben a hang így néz ki: diktálsz egy üzenetet, vársz, elolvasod a választ. Ez nem beszélgetés – ez diktálás. Benne vagyunkNeuralSpacerészben megtörtént"Csevegés"teljes értékűhanghívás: beszélsz, a modell valós időben hanggal válaszol, megtehetedmegszakítani, és hívhatodbármilyen modell- Claude, GPT, DeepSeek - ugyanabban az ablakban. Megérteni, hogyan működik és miért, nehezebb, mint amilyennek látszik.

Miért „diktálás” ≠ beszélgetés

Az élő beszélgetés két olyan dologra támaszkodik, amelyekkel a push-to-talk felületek nem rendelkeznek:

  1. Alacsony késleltetés.A megjegyzésed és a válasz között 3-4 másodperces szünet megöli a párbeszéd érzését. A modellnek szinte azonnal el kell kezdenie válaszolni.
  2. Barge-in.Élőbeszédben folyamatosan félbeszakítjuk: „állj meg, ez nem az”, „röviden”, „tudod…”. Ha egy asszisztens befejezi hosszas gondolkodását, figyelmen kívül hagyva azt, amit már mond, akkor ez nem beszélgetőpartner, ez egy üzenetrögzítő.

Mindkét pont a folyamok architektúrájáról szól, nem pedig a „beszédszintézis összekapcsolásáról”.

Építészet

Full-duplex path: continuous input, streaming of tokens into voice-over, interruption of response when interrupting
Full-duplex útvonal: folyamatos bevitel, tokenek streamelése a hangbeszédbe, a válasz megszakítása megszakításkor

Teljes duplex útvonal.A mikrofon folyamatosan streamel, a felismerés a válasz lejátszásával párhuzamosan történik. Kulcspont: amint a beszéddetektor ezt észlelia felhasználó beszélt, miközben a modell válaszolt, a lejátszás azonnal leáll, a ki nem mondott válasz megszakad, és a megszakítás előtt elmondottakat a modell helyesen kontextusba helyezi – hogy megértse, hol szakították meg.

Modell agnosztikus.A legérdekesebb megoldás az egyetlen hangréteg a különböző modellek tetején. A felhasználó egy ablakban váltja a beszélgetőpartnert: most Claude-dal beszél, egy perc múlva - GPT-vel, majd DeepSeek-el. Ehhez a vokális traktus (felismerés + beszédészlelés + megszakítási logika + szintézis)leválasztva egy adott modellről: A modell a cserélhető „agy” a megosztott hangfelület mögött. Az elérési út az absztrakt folyamattal működik: „replika → válaszjogkivonat-folyam → voiceover”, és nem tudja, ki áll mögötte.

A válasz streamelése hangfelvételbe.Annak érdekében, hogy ne várja meg, amíg a modell befejezi a teljes választ, a tokenek szintézisbe kerülnek generálásuk során, a mondathatárok mentén darabokban. Ez alacsony késleltetést ad, és természetessé teszi a megszakítást: pontosan azt vágjuk le, ami már elhangzott.

Gereblye

  • Hamis riasztás uszály.Köhögés, háttérzaj, „úúú” – a modell rosszkor abbahagyja a beszédet. Kalibrálni kellett a beszéddetektor küszöbértékét, hogy megkülönböztessük a valódi replikát a zajtól.
  • Kontextus megszakítás után.Ha egyszerűen kidob egy kimondatlan választ, a modell „elfelejti”, hogy egyáltalán válaszolt. A beszédrészt elmentjük meneteként a párbeszédben – ekkor a „állj, de inkább a másodikról” értelmesen működik.
  • Modellváltás élő beszélgetésben.A párbeszéd története közös, de a modellek eltérő formátumúak és „karakterek”. Normalizáljuk a történelmet, hogy az új modell felvegye a beszélgetést, ne pedig a nulláról kezdje.

Miért van ez?

A különböző modellek különböző módon erősek: az egyik jobban érvel, a másik kreatívabb, a másik gyorsabb és olcsóbb a fecsegésben. Egy hanghívás váltással természetes forgatókönyvvé változtatja ezt: az egyikkel megbeszéltük az ötletet, a másodikat megkértük, hogy kritizáljon, a harmadikat pedig adjon lehetőségeket. Minden hanggal történik, egyetlen ablakban, bármikor megszakítható. Ugyanaz a hangcsatorna fekszik alattahangügynök webhelyekhez— ott is nyomogatja a gombokat.

Ha nyelvi modellekre épít hangos felületeket, akkor érdemes megvitatni, hogyan oldja meg a behatolást és a kontextus mentését hibás állapot esetén. Próbáld felhívni:neuralspace.pro/chat.

Full-duplex pipeline: continuous input, tokens streamed into speech, playback cut on interruption
Full-duplex pipeline: folyamatos bemenet, tokenek beszédbe közvetítve, lejátszás megszakítása esetén

Gyakran ismételt kérdések (GYIK)

Kérdés: Hogyan lehet a legjobb eredményt elérni egy neurális hálózatból?
Válasz: Használjon részletes angol nyelvű promptokat (leírásokat), állítsa be a jelenet stílusát és részleteit.

Kérdés: Felhasználhatók-e ezek az anyagok kereskedelmi célokra?
Válasz: Igen, a generált tartalom teljes mértékben az Öné.