← 모든 글

사이트를 실제로 제어하는 ​​음성 오브: '말하는 FAQ'가 아닌 어시스턴트의 아키텍처

사이트를 실제로 제어하는 ​​음성 오브: '말하는 FAQ'가 아닌 어시스턴트의 아키텍처

주요 사항에 대해 간략히 설명합니다 (BLUF)

웹사이트의 말하는 위젯은 보조자가 아니라 장난감입니다. 말만 하고 아무 것도 하지 않습니다. 우리의 음성 구는 실제로 사이트를 운영합니다. 내부에는 세 개의 아키텍처 계층, 우리가 밟은 세 개의 갈퀴, 대화의 경제 및 동일한 오브를 웹 사이트에 배치하는 방법이 있습니다.

웹사이트의 음성 비서는 일반적으로 음성 인식이 연결된 챗봇이거나 FAQ 음성 해설의 두 가지 방식 중 하나로 끝납니다. 우리는 NeuralSpace 반대 작업에서 나왔습니다 - 목소리를 내기 위해 인터페이스를 관리하는 주요 방법, 텍스트 위의 상부 구조가 아닙니다. 다음은 아키텍처와 내려진 결정에 대한 분석입니다.

사용자가 복잡한 생성 페이지를 엽니다. 동영상, 영화, 음악 — 모델 선택, 참조 로드, 요청, 매개변수가 있는 경우. 새로 온 사람이 길을 잃었습니다. 사람들은 두 번째 단계에서 클래식 온보딩(화살표가 있는 둘러보기)을 종료합니다. 우리는 간단하게 가능하길 원했습니다 목소리로 말하다: “이 사진에 생기를 불어넣고 싶어요”라고 했더니 어시스턴트가 직접 원하는 버튼을 강조해 설명하고 결과를 가져왔다.

챗봇과의 주요 차이점: orb 페이지 상태를 봅니다 그리고 그녀에게 행동, "어딘가에 X 버튼을 누르세요."라는 텍스트로 응답하는 대신.

아키텍처: 세 개의 레이어

3개 레이어: 성도, 기계가 읽을 수 있는 페이지 스냅샷이 있는 뇌, DOM 위에 있는 실행기
3개 레이어: 성도, 기계가 읽을 수 있는 페이지 스냅샷이 있는 뇌, DOM 위에 있는 실행기
  1. 성대. 스트리밍 음성인식 → 모델 → 응답합성. 요구 사항은 낮은 대기 시간과 능력입니다. 방해하다 (barge-in): 사용자가 말하기 시작합니다 - 어시스턴트는 침묵합니다. 이것이 없으면 대화는 대화라기보다는 무전기처럼 느껴집니다.
  2. 뇌. 우리는 특정 언어 모델에서 어시스턴트의 "개성"을 의도적으로 분리했습니다. 모델은 서버 측에서 구성되므로 프런트 엔드를 다시 개발하지 않고도 작업 및 비용에 맞게 변경할 수 있습니다. 어시스턴트는 사용자의 응답뿐만 아니라 현재 페이지의 기계 판독 가능한 스냅샷: 어떤 요소가 있는지, 어떤 버튼이 있는지, 무엇이 이미 선택되어 있는지.
  3. 클라이언트의 실행자. 모델은 텍스트뿐만 아니라 행위: 요소 강조 표시, 블록으로 스크롤, 필드 설명. 클라이언트는 실제 DOM 위에서 이를 실행합니다.

우리가 밟은 갈퀴 세 개

가장 흥미로운 것은 행복한 길이 아니라 실패입니다. 실제 대화의 로그를 분석하고 근본 규칙을 생각해 냈습니다.

1. 가능성에 대한 환각. 현재 페이지에 없는 모델을 보조자가 추천해 주거나, 사진용 모델과 영상용 모델을 혼동한 경우도 있습니다. 사용자는 "그런 모델은 없습니다"라고 분노한 것은 당연합니다. 수정 - 모델의 "세계에 대한 지식"에 의존하지 마세요. 어시스턴트가 이름을 지정하고 전환할 수 있습니다. 현재 페이지의 스냅샷에 실제로 있는 것만. 이는 전형적인 접지 문제입니다. 모델은 인터페이스 상태와 엄격하게 연결되어야 합니다. 그렇지 않으면 자신있게 거짓말을 할 것입니다.

2. 잘못된 버튼에 불이 들어옵니다. 그들은 "사진 업로드"를 표시하도록 요청합니다. "생성"이 강조 표시됩니다. 그 이유는 모호한 "의도 → 요소" 매핑 때문입니다. 해결책: 요소는 의미론적 앵커를 받고 어시스턴트는 강조 표시해야 합니다. 바로 그 것, 그가 말하는 내용은 의미가 이웃이 아닙니다.

3. 강박관념. 모델이 이미 선택되었습니다. 보조자는 여전히 모델을 변경하려고 시도합니다. 사용자는 "그냥 요청을 작성하세요"라고 묻고 그는 주장합니다. 규칙: 상태가 이미 적합하거나 사용자가 명시적으로 터치하지 말 것을 요청하는 경우 - 행동하거나 논쟁하지 마십시오, 즉시 요청한 작업을 수행하십시오. 주도권은 줄어들고 실행력은 높아집니다.

인터페이스 위에 에이전트를 구축하는 모든 사람에게 우리가 제공할 결론은 다음과 같습니다. 품질의 90%는 모델이 아니라 행동의 기반과 규율입니다. 모델은 정확한 상태를 확인해야 하며 그 상태를 벗어나서는 안 됩니다.

대화의 경제학

음성은 문자보다 비용이 많이 들기 때문에 Orb에는 무료창구가 있으며, 이후 대화 시 결제가 이루어집니다. 요금 청구는 '메시지' 개수가 아니라 음성 상호작용 기간에 따라 결정됩니다.

동일한 구가 귀하의 웹사이트에 있습니다.

우리는 스스로 오브를 사용자 정의했지만 작업은 보편적입니다. 중요하지 않은 인터페이스(구성기, 개인 계정, 복잡한 양식, 필터가 있는 저장)가 있는 모든 사이트는 페이지를 보고 그에 따라 작동하는 음성 가이드의 혜택을 받습니다. 따라서 우리는 이를 임베디드 위젯에 넣었습니다. 설치 방법과 수행할 수 있는 작업은 별도로 논의됩니다. 모든 웹사이트의 음성 에이전트.

비슷한 일을 하고 있다면 접지 및 바지선 접근 방식을 비교하는 것이 흥미로울 것입니다. Orb 라이브를 사용해 볼 수 있습니다. 신경 공간 .pro.

세 가지 레이어: 음성 파이프라인, 기계가 읽을 수 있는 페이지 스냅샷이 있는 브레인, DOM을 통한 클라이언트 실행기
세 가지 레이어: 음성 파이프라인, 기계가 읽을 수 있는 페이지 스냅샷이 있는 브레인, DOM을 통한 클라이언트 실행기

자주 묻는 질문(FAQ)

질문: 신경망에서 최상의 결과를 얻는 방법은 무엇입니까?
답변: 영어로 된 자세한 프롬프트(설명)를 사용하고 장면의 스타일과 세부 사항을 설정하세요.

질문: 이 자료를 상업적 목적으로 사용할 수 있나요?
답변: 예, 생성된 콘텐츠는 전적으로 귀하의 것입니다.