Taleanrop til flere AI-er samtidig i ett vindu: hvordan gjøre "ringe Claude, GPT og DeepSeek" med avbrudd
Kort om det viktigste (BLUF)
Det er upraktisk å sammenligne svarene fra modellene en etter en, og "diktat" er ennå ikke en samtale. Vi foretok et taleanrop der Claude, GPT og DeepSeek svarer i samme vindu. Vi vil fortelle deg hvordan en samtale skiller seg fra en diktat, hvordan arkitekturen fungerer og hvilke feil du har gjort.
I de fleste chatter med AI ser stemmen slik ut: du dikterer en melding, vent, les svaret. Dette er ikke en samtale - dette er et diktat. Vi er medNeuralSpacegjort i seksjonen"Chat"fullverdigtaleanrop: du snakker, modellen svarer med en stemme i sanntid, du kanavbryte, og du kan ringehvilken som helst modell- Claude, GPT, DeepSeek - i samme vindu. Å forstå hvordan det fungerer og hvorfor er vanskeligere enn det ser ut til.
Hvorfor «diktat» ≠ samtale
En live-samtale er avhengig av to ting som push-to-talk-grensesnitt ikke har:
- Lav ventetid.En pause på 3-4 sekunder mellom kommentaren din og svaret dreper følelsen av dialog. Modellen skal begynne å svare nesten umiddelbart.
- Innkjøring.I levende tale avbryter vi hele tiden: "stopp, det er ikke det", "kort sagt", "kan du ...". Hvis en assistent avslutter sin lange tanke og ignorerer det du allerede sier, er dette ikke en samtalepartner, dette er en telefonsvarer.
Begge punktene handler om arkitekturen til bekker, og ikke om "forbindelse av talesyntese."
Arkitektur

Full tosidig bane.Mikrofonen strømmer kontinuerlig, gjenkjenning skjer parallelt med avspilling av svaret. Hovedpoeng: så snart taledetektoren fanger opp detbrukeren snakket mens modellen svarte, avspillingen stopper umiddelbart, det usagte svaret kuttes av, og hva modellen rakk å si før avbruddet settes riktig inn i kontekst – slik at hun forstår hvor hun ble avbrutt.
Modellagnostiker.Den mest interessante løsningen er et enkelt stemmelag på toppen av forskjellige modeller. Brukeren bytter samtalepartner i ett vindu: nå snakker han med Claude, om et minutt - med GPT, deretter med DeepSeek. For dette, vokalkanalen (gjenkjenning + talegjenkjenning + avbruddslogikk + syntese)løsnet fra en bestemt modell: Modellen er den utskiftbare "hjernen" bak det delte stemmegrensesnittet. Banen fungerer med den abstrakte flyten «replika → respons token flow → voiceover» og vet ikke hvem som står bak.
Strømmer svaret til voiceover.For ikke å vente på at modellen skal fullføre hele svaret, blir tokens syntese etter hvert som de genereres, i biter langs setningsgrensene. Dette gir en lav forsinkelse og gjør det naturlig å avbryte: vi avskjærer nøyaktig det som allerede er sagt.
Rake
- Falsk alarm-innkjøring.Hoste, bakgrunnsstøy, "uh-he" - modellen slutter å snakke på feil tidspunkt. Vi måtte kalibrere terskelen til taledetektoren for å skille den virkelige kopien fra støyen.
- Kontekst etter avbrudd.Hvis du bare kaster ut et uuttalt svar, "glemmer" modellen at den i det hele tatt svarte. Vi lagrer den talte delen som sin kurs i dialogen - så fungerer "stopp, men mer om det andre" meningsfullt.
- Bytte modell i en live-samtale.Historien om dialogen er felles, men modellene har forskjellige formater og "karakterer". Vi normaliserer historien slik at den nye modellen tar opp samtalen i stedet for å starte fra bunnen av.
Hvorfor er dette
Ulike modeller er sterke på forskjellige måter: en er flinkere til å resonnere, en annen er mer kreativ, en annen er raskere og billigere for skravling. Et taleanrop med bytte gjør dette til et naturlig scenario: diskuterte ideen med en, ba den andre om å kritisere og den tredje om å gi alternativer. Alt gjøres med stemmen, i ett vindu, med muligheten til å avbryte når som helst. Den samme stemmekanalen ligger undertaleagent for nettsteder— der trykker han også på knapper.
Hvis du bygger talegrensesnitt på toppen av språkmodeller, er det interessant å diskutere hvordan du løser barge-in og lagrer kontekst når den brytes. Prøv å ringe:neuralspace.pro/chat.

Vanlige spørsmål (FAQ)
Spørsmål: Hvordan få det beste resultatet fra et nevralt nettverk?
Svar: Bruk detaljerte ledetekster (beskrivelser) på engelsk, angi stilen og detaljene for scenen.
Spørsmål: Kan disse materialene brukes til kommersielle formål?
Svar: Ja, det genererte innholdet er helt og holdent ditt.