En stemmekugle, der faktisk styrer webstedet: arkitekturen af en assistent, ikke en "talende FAQ"
Kort om det vigtigste (BLUF)
En talende widget på en hjemmeside er ikke en assistent, men et legetøj: den taler, men gør ingenting. Vores stemmekugle styrer virkelig webstedet. Indeni er tre lag af arkitektur, tre river, som vi trådte på, økonomien i dialog og en måde at sætte den samme kugle på din hjemmeside.
Stemmeassistenter på websteder ender normalt på en af to måder: enten er det en chatbot med talegenkendelse tilknyttet, eller det er en FAQ-voiceover. Vi er medNeural Spacegik fra den omvendte opgave - at lave en stemmeden vigtigste måde at styre grænsefladen på, og ikke en overbygning over teksten. Nedenfor er en analyse af arkitekturen og de beslutninger, der skulle træffes.
Opgave
Brugeren åbner en kompleks genereringsside −video, billeder, musik— hvor der er et valg af model, indlæsning af en reference, en anmodning, parametre. Den nytilkomne er tabt. Folk lukker den klassiske onboarding (tur med pile) på andet trin. Vi ønskede, at det skulle være muligt at simpelthensige med en stemme: "Jeg vil bringe dette billede til live," og assistenten selv fremhævede den ønskede knap, forklarede det og bragte det til resultatet.
Nøgleforskel fra en chatbot: orbser sidens tilstandOgvirker på hende, i stedet for at svare med teksten "tryk på X-knappen et sted der."
Arkitektur: tre lag

- Vokalkanalen.Streaming talegenkendelse → model → responssyntese. Kravet er lav latenstid og evnenafbryde(pram-in): brugeren begynder at tale - assistenten bliver stille. Uden dette føles dialogen som en walkie-talkie snarere end en samtale.
- Hjerne.Vi afkoblede bevidst assistentens "personlighed" fra en specifik sprogmodel: Modellen er konfigureret på serversiden, så den kan ændres, så den passer til opgaven og omkostningerne uden at genudvikle frontenden. Assistenten modtager ikke kun brugerens svar, men ogsåmaskinlæsbart øjebliksbillede af den aktuelle side: hvilke elementer er der, hvilke knapper, hvad er allerede valgt.
- Eksekutør på klienten.Modellen returnerer ikke kun tekst, men ogsåhandlinger: fremhæve element, rul til blok, forklar felt. Klienten udfører dem oven på den rigtige DOM.
Tre river trådte vi på
Det mest interessante er ikke den lykkelige vej, men fiaskoerne. Vi analyserede logfilerne for rigtige dialoger og kom frem til rodreglerne.
1. Hallucination af muligheder.Assistenten foreslog modeller, der ikke var på den aktuelle side, eller forvekslede modellen til billeder med modellen til video. Brugeren er med rette vred: "der er ingen sådan model." Fix - stol ikke på modellens "viden om verden": assistenten kan navngive og skiftekun hvad der rent faktisk er i snapshot af den aktuelle side. Dette er et klassisk jordingsproblem - modellen skal være strengt bundet til grænsefladens tilstand, ellers vil den trygt lyve.
2. Den forkerte knap lyser.De beder dig om at vise "upload et foto" - "Generer" er fremhævet. Årsagen er den uklare "hensigt → element"-kortlægning. Løsning: elementer modtager semantiske ankre, og assistenten skal fremhævelige præcis den, som han taler om, og ikke nabo i betydningen.
3. Besættelse.Modellen er allerede valgt - assistenten forsøger stadig at ændre den; brugeren spørger "bare skriv en anmodning" - og han argumenterer. Regel: hvis tilstanden allerede er egnet, eller brugeren udtrykkeligt beder om ikke at røre -ikke handle eller argumentere, gør straks, hvad der bliver bedt om. Mindre initiativ, mere eksekvering.
Konklusionen, vi vil give til enhver, der bygger en agent oven på en grænseflade, er:90% af kvalitet er ikke en model, men jordforbindelse og disciplin i handling. Modellen skal se den nøjagtige tilstand og må ikke gå ud over den.
Dialogens økonomi
Stemme er dyrere end tekst, så Orb har et gratis vindue, så betales der ved samtale. Fakturering er bundet til varigheden af stemmeinteraktionen, ikke antallet af "beskeder".
Den samme kugle er på din hjemmeside
Vi tilpassede kuglen til os selv, men opgaven er universel: ethvert websted med en ikke-triviel grænseflade (konfigurator, personlig konto, kompleks form, butik med filtre) drager fordel af en stemmeguide, der ser siden og handler på den. Derfor sætter vi den ind i en indlejret widget - hvordan den er installeret, og hvad den kan gøre, diskuteres separat:stemmeagent for enhver hjemmeside.
Hvis du laver noget lignende, er det interessant at sammenligne tilgangene til grundstødning og barge-in. Du kan prøve orb live klneuralspace.pro.

Ofte stillede spørgsmål (FAQ)
Spørgsmål: Hvordan får man det bedste resultat fra et neuralt netværk?
Svar: Brug detaljerede prompter (beskrivelser) på engelsk, indstil stilen og detaljerne for scenen.
Spørgsmål: Kan disse materialer bruges til kommercielle formål?
Svar: Ja, det genererede indhold er helt dit.