← Все статьи

Hlasová koule, která skutečně ovládá web: architektura asistenta, nikoli „mluvící FAQ“

Hlasová koule, která skutečně ovládá web: architektura asistenta, nikoli „mluvící FAQ“

Krátce o hlavní věci (BLUF)

Mluvící widget na webu není asistent, ale hračka: mluví, ale nic nedělá. Naše hlasová koule skutečně provozuje web. Uvnitř jsou tři vrstvy architektury, tři hrábě, na které jsme šlápli, ekonomika dialogu a způsob, jak umístit stejnou kouli na váš web.

Hlasoví asistenti na webových stránkách obvykle končí jedním ze dvou způsobů: buď je to chatbot s připojeným rozpoznáváním řeči, nebo je to hlasový projev FAQ. jsme vNeuralSpacevyšel z inverzního úkolu - vytvořit hlashlavní způsob správy rozhraní, a nikoli nadstavba nad textem. Níže je uvedena analýza architektury a rozhodnutí, která bylo třeba učinit.

Úkol

Uživatel otevře složitou stránku generování −video, obrázky, hudba— kde je výběr modelu, načítání reference, požadavku, parametrů. Nováček je ztracen. Klasický onboarding (prohlídka se šipkami) lidé zavírají na druhém kroku. Chtěli jsme, aby to bylo možné jednodušeříct hlasem: „Chci oživit tuto fotku,“ a sám asistent požadované tlačítko zvýraznil, vysvětlil a dovedl k výsledku.

Klíčový rozdíl od chatbota: orbvidí stav stránkyApůsobí na nimísto odpovědi textem „stiskněte někde tlačítko X“.

Architektura: tři vrstvy

Three layers: vocal tract, brain with machine-readable page snapshot, executor on top of DOM
Tři vrstvy: vokální trakt, mozek se strojově čitelným snímkem stránky, exekutor na vrcholu DOM
  1. Vokální trakt.Rozpoznávání řeči streamování → model → syntéza odezvy. Požadavkem je nízká latence a schopnostpřerušit(barge-in): uživatel začne mluvit - asistent ztichne. Bez toho mi dialog připadá spíše jako vysílačka než jako rozhovor.
  2. Mozek.Záměrně jsme oddělili „osobnost“ asistenta od konkrétního jazykového modelu: model je nakonfigurován na straně serveru, takže jej lze změnit tak, aby vyhovoval úkolu a nákladům, aniž by bylo nutné znovu vyvíjet frontend. Asistent obdrží nejen odpověď uživatele, ale takéstrojově čitelný snímek aktuální stránky: jaké prvky tam jsou, jaká tlačítka, co je již vybráno.
  3. Exekutor na klienta.Model vrací nejen text, ale takéakce: zvýraznění prvku, posunutí k bloku, vysvětlení pole. Klient je spouští nad skutečným DOM.

Tři hrábě, na které jsme šlápli

Nejzajímavější na tom není šťastná cesta, ale neúspěchy. Analyzovali jsme protokoly skutečných dialogů a přišli s kořenovými pravidly.

1. Halucinace možností.Asistent navrhl modely, které nebyly na aktuální stránce, nebo si modelku spletl pro obrázky s modelem pro video. Uživatel se právem zlobí: "žádný takový model neexistuje." Oprava – nespoléhejte na „znalost světa“ modelu: asistent může pojmenovat a přepnoutpouze to, co je skutečně na snímku aktuální stránky. Jedná se o klasický problém uzemnění - model musí být přísně svázán se stavem rozhraní, jinak bude sebevědomě ležet.

2. Svítí nesprávné tlačítko.Požádají vás, abyste ukázali „nahrát fotku“ – zvýrazní se „Generovat“. Důvodem je fuzzy mapování „intent → element“. Řešení: prvky obdrží sémantické kotvy a asistent musí zvýraznitpřesně ten, o kterém mluví, a nikoli významově sousedící.

3. Obsesivita.Model je již vybrán - asistent se jej stále snaží změnit; uživatel se ptá „stačí napsat žádost“ - a argumentuje. Pravidlo: pokud je stav již vhodný nebo uživatel výslovně žádá, aby se nedotýkal -nejednat ani se nehádat, okamžitě udělejte, co je požadováno. Méně iniciativy, více realizace.

Závěr, který bychom dali každému, kdo buduje agenta na rozhraní, je:90% kvality není model, ale uzemnění a disciplína jednání. Model musí vidět přesný stav a nesmí ho překročit.

Ekonomika dialogu

Hlas je dražší než text, takže Orb má bezplatné okno, poté se platba provede po rozhovoru. Fakturace je vázána na dobu trvání hlasové interakce, nikoli na počet „zpráv“.

Stejná koule je na vašem webu

Orb jsme si přizpůsobili pro sebe, ale úkol je univerzální: jakýkoli web s netriviálním rozhraním (konfigurátor, osobní účet, složitý formulář, obchod s filtry) těží z hlasového průvodce, který stránku vidí a působí na ni. Proto jsme jej vložili do vestavěného widgetu - jak se instaluje a co umí, je diskutováno samostatně:hlasový agent pro jakýkoli web.

Pokud děláte něco podobného, ​​je zajímavé porovnat přístupy k uzemnění a nalodění. Orb si můžete vyzkoušet naživoneuroprostor.pro.

Three layers: voice pipeline, brain with a machine-readable page snapshot, client executor over the DOM
Tři vrstvy: hlasový kanál, mozek se strojově čitelným snímkem stránky, spouštěcí program klienta přes DOM

Často kladené otázky (FAQ)

Otázka: Jak získat nejlepší výsledek z neuronové sítě?
Odpověď: Použijte podrobné výzvy (popisy) v angličtině, nastavte styl a detaily scény.

Otázka: Mohou být tyto materiály použity pro komerční účely?
Odpověď: Ano, vygenerovaný obsah je zcela váš.