← Kaikki artikkelit

Äänipuhelu usealle tekoälylle kerralla yhdessä ikkunassa: kuinka soittaa Claudelle, GPT:lle ja DeepSeekille keskeytyksettä

Äänipuhelu usealle tekoälylle kerralla yhdessä ikkunassa: kuinka soittaa Claudelle, GPT:lle ja DeepSeekille keskeytyksettä

Lyhyesti pääasiasta (BLUF)

Mallien vastauksia on hankala verrata yksitellen, eikä "sanelu" ole vielä keskustelua. Teimme äänipuhelun, jossa Claude, GPT ja DeepSeek vastaavat samassa ikkunassa. Kerromme, miten puhelu eroaa sanelusta, miten arkkitehtuuri toimii ja mitä virheitä olet tehnyt.

Useimmissa AI-keskusteluissa ääni näyttää tältä: sanelet viestin, odotat, luet vastauksen. Tämä ei ole keskustelu - tämä on sanelu. Olemme mukanaNeuralSpacetehty osiossa"Chat"täysivaltainenäänipuhelu: puhut, malli vastaa äänellä reaaliajassa, voitkeskeyttää, ja voit soittaamikä tahansa malli- Claude, GPT, DeepSeek - samassa ikkunassa. Sen toiminnan ja miksi ymmärtäminen on vaikeampaa kuin miltä näyttää.

Miksi "sanelu" ≠ keskustelu

Live-keskustelu perustuu kahteen asiaan, joita push-to-talk-liitännöissä ei ole:

  1. Matala latenssi.3-4 sekunnin tauko huomautuksesi ja vastauksesi välillä tappaa dialogin tunteen. Mallin pitäisi alkaa reagoimaan lähes välittömästi.
  2. Proomu sisään.Elävässä puheessa keskeytämme jatkuvasti: "lopeta, ei se siinä", "lyhyesti", "voitko...". Jos avustaja päättää pitkän ajatuksensa jättäen huomioimatta sen, mitä jo sanot, tämä ei ole keskustelukumppani, tämä on puhelinvastaaja.

Molemmat kohdat koskevat virtojen arkkitehtuuria eivätkä "puhesynteesin yhdistämistä".

Arkkitehtuuri

Full-duplex path: continuous input, streaming of tokens into voice-over, interruption of response when interrupting
Full-duplex-polku: jatkuva syöttö, merkkien suoratoisto puheäänentoistoon, vasteen keskeytyminen keskeytettäessä

Full duplex polku.Mikrofoni virtaa jatkuvasti, tunnistus tapahtuu samanaikaisesti vastauksen toiston kanssa. Keskeinen asia: heti kun puheentunnistin havaitsee senkäyttäjä puhui, kun malli vastasi, toisto pysähtyy välittömästi, lausumaton vastaus katkeaa ja se, mitä malli onnistui sanomaan ennen keskeytystä, asetetaan oikein kontekstiin - jotta hän ymmärtää, mihin hänet keskeytettiin.

Malliagnostikko.Mielenkiintoisin ratkaisu on yksi äänikerros eri mallien päällä. Käyttäjä vaihtaa keskustelukumppania yhdessä ikkunassa: nyt hän puhuu Clauden kanssa, minuutissa - GPT:llä, sitten DeepSeekin kanssa. Tätä varten äänikanava (tunnistus + puheentunnistus + keskeytyslogiikka + synteesi)irrotettu tietystä mallista: Malli on vaihdettava "aivot" jaetun äänirajapinnan takana. Polku toimii abstraktin virran "replica → vastaus token flow → voiceover" kanssa eikä tiedä kuka sen takana on.

Suoratoista vastaus selostukseen.Jotta mallin ei odoteta täyttävän koko vastausta, merkit siirtyvät synteesiin sitä mukaa kun niitä luodaan paloina lauseiden rajoja pitkin. Tämä antaa pienen viiveen ja tekee keskeytyksestä luonnollisen: katkaisemme tarkalleen sen, mitä on jo sanottu.

Rake

  • Väärä hälytys.Yskä, taustamelu, "uh-huh" - malli lakkaa puhumasta väärään aikaan. Meidän piti kalibroida puheentunnistimen kynnys erottaaksemme todellisen jäljennöksen kohinasta.
  • Konteksti keskeytyksen jälkeen.Jos yksinkertaisesti heittää lausumattoman vastauksen, malli "unohtaa", että se vastasi ollenkaan. Tallennamme puhutun osan sen kurssiksi dialogissa - silloin ”pysähdy, mutta lisää toisesta” toimii mielekkäästi.
  • Mallin vaihto suorassa keskustelussa.Dialogin historia on yhteinen, mutta malleilla on erilaisia ​​muotoja ja ”hahmoja”. Normalisoimme historiaa, jotta uusi malli poimii keskustelun sen sijaan, että aloitettaisiin tyhjästä.

Miksi tämä on?

Eri mallit ovat vahvoja eri tavoin: toinen on parempi päättelyssä, toinen on luovempi, toinen nopeampi ja halvempi keskusteluun. Äänipuhelu vaihdon kanssa muuttaa tämän luonnolliseksi skenaarioksi: keskusteltiin ideasta toisen kanssa, pyysivät toista arvostelemaan ja kolmatta antamaan vaihtoehtoja. Kaikki tehdään äänellä, yhdessä ikkunassa, jolloin voidaan keskeyttää milloin tahansa. Sama äänikanava on allaääniagentti verkkosivustoille- siellä hän myös painaa painikkeita.

Jos rakennat äänirajapintoja kielimallien päälle, on mielenkiintoista keskustella siitä, kuinka ratkaiset sisäänpääsyn ja kontekstin säästämisen rikkinäisenä. Kokeile soittaa:neuralspace.pro/chat.

Full-duplex pipeline: continuous input, tokens streamed into speech, playback cut on interruption
Full-duplex-liukuhihna: jatkuva syöttö, puheen suoratoistona, toisto katkaistaan ​​keskeytyksen yhteydessä

Usein kysytyt kysymykset (FAQ)

Kysymys: Kuinka saada paras tulos hermoverkosta?
Vastaus: Käytä yksityiskohtaisia ​​kehotteita (kuvauksia) englanniksi, aseta kohtauksen tyyli ja yksityiskohdat.

Kysymys: Voidaanko näitä materiaaleja käyttää kaupallisiin tarkoituksiin?
Vastaus: Kyllä, luotu sisältö on kokonaan sinun.