← Alla artiklar

Röstsamtal till flera AI:er samtidigt i ett fönster: hur man ringer "samtal Claude, GPT och DeepSeek" med avbrott

Röstsamtal till flera AI:er samtidigt i ett fönster: hur man ringer "samtal Claude, GPT och DeepSeek" med avbrott

Kort om det viktigaste (BLUF)

Det är obekvämt att jämföra svaren från modeller en efter en, och "diktat" är ännu inte en konversation. Vi ringde ett röstsamtal där Claude, GPT och DeepSeek svarar i samma fönster. Vi berättar hur ett samtal skiljer sig från ett diktat, hur arkitekturen fungerar och vilka misstag du har gjort.

I de flesta chattar med AI ser rösten ut så här: du dikterar ett meddelande, väntar, läser svaret. Det här är inte en konversation - det här är ett diktat. Vi är med Neural Space gjort i avsnittet "chatta" fullfjädrad röstsamtal: du talar, modellen svarar med en röst i realtid, du kan avbryta, och du kan ringa vilken modell som helst - Claude, GPT, DeepSeek - i samma fönster. Att förstå hur det fungerar och varför är svårare än det verkar.

Varför "diktat" ≠ samtal

En livekonversation bygger på två saker som push-to-talk-gränssnitt inte har:

  1. Låg latens. En paus på 3-4 sekunder mellan din kommentar och svaret dödar känslan av dialog. Modellen bör börja svara nästan omedelbart.
  2. Pråm-in. I levande tal avbryter vi ständigt: "sluta, det är inte det", "kort sagt", "kan du...". Om en assistent avslutar sin långa tanke och ignorerar det du redan säger, är detta inte en samtalspartner, det här är en telefonsvarare.

Båda punkterna handlar om strömmars arkitektur och inte om "att koppla samman talsyntes."

Arkitektur

Full-duplex-sökväg: kontinuerlig inmatning, streaming av tokens till voice-over, avbrott av svar vid avbrott
Full-duplex-sökväg: kontinuerlig inmatning, streaming av tokens till voice-over, avbrott av svar vid avbrott

Full duplex-bana. Mikrofonen strömmar kontinuerligt, igenkänning sker parallellt med uppspelningen av svaret. Nyckelpunkt: så fort taldetektorn fångar det användaren talade medan modellen svarade, uppspelningen stoppas omedelbart, det outtalade svaret klipps bort och vad modellen hann säga innan avbrottet sätts korrekt in i sitt sammanhang - så att hon förstår var hon blev avbruten.

Modellagnostiker. Den mest intressanta lösningen är ett enda röstlager ovanpå olika modeller. Användaren växlar samtalspartner i ett fönster: nu pratar han med Claude, om en minut - med GPT, sedan med DeepSeek. För detta, röstkanalen (igenkänning + taldetektering + avbrottslogik + syntes) lossad från en specifik modell: Modellen är den utbytbara "hjärnan" bakom det delade röstgränssnittet. Vägen arbetar med det abstrakta flödet ”replika → svarstokenflöde → voiceover” och vet inte vem som ligger bakom.

Streamar svaret till voiceover. För att inte vänta på att modellen ska slutföra hela svaret, går tokens i syntes när de genereras, i bitar längs meningarnas gränser. Detta ger en låg fördröjning och gör det naturligt att avbryta: vi skär av exakt det som redan har sagts.

Räfsa

  • Falskt larm-inbrott. Hosta, bakgrundsljud, "uh-huh" - modellen slutar prata vid fel tidpunkt. Vi var tvungna att kalibrera tröskeln för taldetektorn för att skilja den verkliga repliken från bruset.
  • Sammanhang efter avbrott. Om du bara slänger ut ett outtalat svar, "glömmer" modellen att den svarade överhuvudtaget. Vi sparar den talade delen som sin kurs i dialogen - sedan fungerar "stopp, men mer om det andra" meningsfullt.
  • Byt modell i en livekonversation. Dialogens historia är gemensam, men modellerna har olika format och ”karaktärer”. Vi normaliserar historien så att den nya modellen tar upp konversationen snarare än att börja om från början.

Varför är detta

Olika modeller är starka på olika sätt: en är bättre på att resonera, en annan är mer kreativ, en annan är snabbare och billigare för prat. Ett röstsamtal med växling gör detta till ett naturligt scenario: diskuterade idén med en, bad den andra att kritisera och den tredje att ge alternativ. Allt görs med rösten, i ett fönster, med möjligheten att avbryta när som helst. Samma stämband ligger under röstagent för webbplatser — där trycker han också på knappar.

Om du bygger röstgränssnitt ovanpå språkmodeller är det intressant att diskutera hur du löser prutning och sparar sammanhang när det är trasigt. Testa att ringa: neuralspace.pro/chat.

Full-duplex pipeline: kontinuerlig inmatning, tokens strömmade till tal, uppspelningen avbryts vid avbrott
Full-duplex pipeline: kontinuerlig inmatning, tokens strömmade till tal, uppspelningen avbryts vid avbrott

Vanliga frågor (FAQ)

Fråga: Hur får man det bästa resultatet från ett neuralt nätverk?
Svar: Använd detaljerade uppmaningar (beskrivningar) på engelska, ställ in stilen och detaljerna för scenen.

Fråga: Kan dessa material användas för kommersiella ändamål?
Svar: Ja, det genererade innehållet är helt och hållet ditt.