← Alle artikelen

Spraakoproep naar meerdere AI's tegelijk in één venster: hoe u "Claude, GPT en DeepSeek" kunt bellen met onderbreking

Spraakoproep naar meerdere AI's tegelijk in één venster: hoe u "Claude, GPT en DeepSeek" kunt bellen met onderbreking

Kort over het belangrijkste (BLUF)

Het is lastig om de antwoorden van modellen één voor één te vergelijken, en 'dicteren' is nog geen gesprek. We hebben een spraakoproep gedaan waarbij Claude, GPT en DeepSeek in hetzelfde venster antwoorden. We vertellen u hoe een gesprek verschilt van een dictaat, hoe de architectuur werkt en welke fouten u heeft gemaakt.

In de meeste chats met AI ziet de stem er zo uit: je dicteert een bericht, wacht, leest het antwoord. Dit is geen gesprek - dit is een dictaat. Wij zijn binnen Neurale ruimte gedaan in de sectie "Chatten" volwaardig spraakoproep: jij spreekt, het model reageert in realtime met een stem, dat kan onderbrekenen je kunt bellen elk model - Claude, GPT, DeepSeek - in hetzelfde venster. Begrijpen hoe het werkt en waarom is moeilijker dan het lijkt.

Waarom “dicteren” ≠ conversatie is

Een live gesprek is afhankelijk van twee dingen die push-to-talk-interfaces niet hebben:

  1. Lage latentie. Een pauze van 3-4 seconden tussen uw opmerking en het antwoord doodt het gevoel van dialoog. Het model zou vrijwel onmiddellijk moeten reageren.
  2. Binnenvallen. Bij live toespraken onderbreken we voortdurend: "stop, dat is het niet", "kortom", "kun je ...". Als een assistent zijn lange gedachte beëindigt en negeert wat u al zegt, is dit geen gesprekspartner, maar een antwoordapparaat.

Beide punten gaan over de architectuur van streams, en niet over het ‘verbinden van spraaksynthese’.

Architectuur

Full-duplex pad: continue invoer, streaming van tokens in voice-over, onderbreking van de reactie bij onderbreken
Full-duplex pad: continue invoer, streaming van tokens in voice-over, onderbreking van de reactie bij onderbreken

Volledig duplexpad. De microfoon streamt continu, herkenning vindt parallel plaats met het afspelen van het antwoord. Belangrijk punt: zodra de spraakdetector dat opvangt de gebruiker sprak terwijl het model reageerde, het afspelen stopt onmiddellijk, het onuitgesproken antwoord wordt afgebroken en wat het model vóór de onderbreking wist te zeggen, wordt correct in context geplaatst - zodat ze begrijpt waar ze werd onderbroken.

Model-agnostisch. De meest interessante oplossing is een enkele stemlaag bovenop verschillende modellen. De gebruiker schakelt de gesprekspartner in één venster: nu praat hij met Claude, over een minuut - met GPT, dan met DeepSeek. Hiervoor het spraakkanaal (herkenning + spraakdetectie + onderbrekingslogica + synthese) losgemaakt van een specifiek model: Het model is het vervangbare ‘brein’ achter de gedeelde spraakinterface. Het pad werkt met de abstracte stroom “replica → responstokenstroom → voice-over” en weet niet wie erachter zit.

Het antwoord streamen naar een voice-over. Om niet te wachten tot het model het volledige antwoord heeft voltooid, gaan tokens in synthese zodra ze worden gegenereerd, in stukjes langs de grenzen van zinnen. Dit geeft een lage vertraging en maakt onderbreken natuurlijk: we snijden precies af wat er al is gezegd.

Hark

  • Vals alarm binnenvallen. Hoest, achtergrondgeluid, "uh-huh" - het model stopt op het verkeerde moment met praten. We moesten de drempel van de spraakdetector kalibreren om de echte replica van de ruis te onderscheiden.
  • Context na onderbreking. Als je simpelweg een onuitgesproken antwoord weggooit, ‘vergeet’ het model dat het überhaupt heeft geantwoord. We bewaren het gesproken deel als het verloop ervan in de dialoog - en dan werkt "stop, maar meer over de tweede" zinvol.
  • Het model wisselen in een live gesprek. De geschiedenis van de dialoog is gebruikelijk, maar de modellen hebben verschillende formaten en ‘karakters’. We normaliseren de geschiedenis, zodat het nieuwe model het gesprek oppikt in plaats van helemaal opnieuw te beginnen.

Waarom is dit

Verschillende modellen zijn op verschillende manieren sterk: de een is beter in redeneren, de ander is creatiever, een ander is sneller en goedkoper in chatten. Een telefoongesprek met schakelen maakt dit tot een natuurlijk scenario: besprak het idee met de een, vroeg de tweede om kritiek te leveren en de derde om opties te geven. Alles gebeurt met uw stem, in één venster, met de mogelijkheid om op elk moment te onderbreken. Hetzelfde stemkanaal ligt eronder stemagent voor websites – daar drukt hij ook op knoppen.

Als u spraakinterfaces bovenop taalmodellen bouwt, is het interessant om te bespreken hoe u binnenvallen oplost en context opslaat als deze niet werken. Probeer te bellen: neuralspace.pro/chat.

Full-duplex pijplijn: continue invoer, tokens gestreamd in spraak, afspelen afgebroken bij onderbreking
Full-duplex pijplijn: continue invoer, tokens gestreamd in spraak, afspelen afgebroken bij onderbreking

Veelgestelde vragen (FAQ)

Vraag: Hoe haal je het beste resultaat uit een neuraal netwerk?
Antwoord: Gebruik gedetailleerde aanwijzingen (beschrijvingen) in het Engels, stel de stijl en details van de scène in.

Vraag: Kunnen deze materialen gebruikt worden voor commerciële doeleinden?
Antwoord: Ja, de gegenereerde inhoud is geheel van jou.