← 모든 글

하나의 창에서 동시에 여러 AI에 음성 통화: 중단과 함께 "전화 Claude, GPT 및 DeepSeek"를 만드는 방법

하나의 창에서 동시에 여러 AI에 음성 통화: 중단과 함께 "전화 Claude, GPT 및 DeepSeek"를 만드는 방법

주요 사항에 대해 간략히 설명합니다 (BLUF)

모델들의 답변을 하나씩 비교하는 것도 불편하고, 받아쓰기도 아직 대화가 아니다. 같은 창에서 Claude, GPT, DeepSeek가 응답하는 음성통화를 걸었습니다. 전화가 받아쓰기와 어떻게 다른지, 아키텍처가 어떻게 작동하는지, 어떤 실수를 했는지 알려드리겠습니다.

대부분의 AI 채팅에서 음성은 다음과 같습니다. 메시지를 지시하고 잠시 기다렸다가 답변을 읽어보세요. 이것은 대화가 아닙니다. 이것은 받아쓰기입니다. 우리는 신경공간 섹션에서 완료 "채팅" 본격적인 음성 통화: 당신이 말하면 모델이 실시간으로 음성으로 반응합니다. 방해하다, 그리고 전화를 걸 수 있습니다 모든 모델 - Claude, GPT, DeepSeek - 같은 창에서. 작동 방식과 이유를 이해하는 것은 보이는 것보다 더 어렵습니다.

왜 '받아쓰기' ≠ 대화인가?

실시간 대화는 PTT(Push-to-Talk) 인터페이스에 없는 두 가지 사항에 의존합니다.

  1. 낮은 대기 시간. 귀하의 발언과 답변 사이에 3~4초의 공백이 있으면 대화의 느낌이 사라집니다. 모델은 거의 즉시 반응하기 시작해야 합니다.
  2. 참여. 라이브 연설에서 우리는 "그만해, 그게 아니야", "간단히", "할 수 있니…"라는 말을 끊임없이 중단합니다. 조수가 이미 말한 내용을 무시하고 오랜 생각을 마친다면 이것은 대담자가 아니라 자동 응답기입니다.

두 요점 모두 "음성 합성 연결"에 관한 것이 아니라 스트림 아키텍처에 관한 것입니다.

건축학

전이중 경로: 연속 입력, 음성 해설로 토큰 스트리밍, 중단 시 응답 중단
전이중 경로: 연속 입력, 음성 해설로 토큰 스트리밍, 중단 시 응답 중단

전이중 경로. 마이크는 지속적으로 스트리밍되며 답변 재생과 동시에 인식이 발생합니다. 요점: 음성 탐지기가 이를 포착하자마자 모델이 응답하는 동안 사용자가 말함, 재생이 즉시 중지되고, 무언의 대답이 끊어지며, 중단되기 전에 모델이 말한 내용이 맥락에 올바르게 적용되므로 모델은 중단된 위치를 이해할 수 있습니다.

모델에 구애받지 않습니다. 가장 흥미로운 솔루션은 다양한 모델 위에 단일 음성 레이어를 추가하는 것입니다. 사용자는 하나의 창에서 대담자를 전환합니다. 이제 그는 Claude로, 잠시 후에 GPT로, 그다음 DeepSeek로 대화합니다. 이를 위해 성도(인식+음성검출+중단논리+합성) 특정 모델에서 분리: 모델은 공유 음성 인터페이스 뒤에 있는 교체 가능한 "두뇌"입니다. 경로는 추상 흐름 “복제본 → 응답 토큰 흐름 → 음성 해설”과 함께 작동하며 그 뒤에 누가 있는지 알 수 없습니다.

답변을 음성 해설로 스트리밍합니다. 모델이 전체 답변을 완료할 때까지 기다리지 않기 위해 토큰은 문장 경계를 따라 청크로 생성되면서 합성됩니다. 이는 지연 시간을 줄이고 중단을 자연스럽게 만듭니다. 이미 말한 내용을 정확하게 잘라냅니다.

갈퀴

  • 허위 경보 끼어들기. 기침, 배경 소음, "어허" - 모델이 잘못된 시간에 말을 멈춥니다. 우리는 실제 복제품과 잡음을 구별하기 위해 음성 탐지기의 임계값을 보정해야 했습니다.
  • 중단 후 상황. 무언의 답변을 단순히 던지는 경우 모델은 자신이 답변한 사실을 전혀 "잊습니다". 말한 부분을 대화의 과정으로 저장합니다. 그런 다음 "중지하되 두 번째에 대한 자세한 내용"이 의미있게 작동합니다.
  • 실시간 대화에서 모델을 전환합니다. 대화의 역사는 공통적이지만 모델은 형식과 "문자"가 다릅니다. 우리는 새 모델이 처음부터 시작하는 대신 대화를 이어갈 수 있도록 기록을 정규화하고 있습니다.

왜 이런거야?

다양한 모델은 다양한 방식으로 강력합니다. 하나는 추론에 더 뛰어나고, 다른 모델은 더 창의적이며, 다른 모델은 채팅에 더 빠르고 저렴합니다. 전환이 포함된 음성 통화는 이를 자연스러운 시나리오로 전환합니다. 한 사람과 아이디어를 논의하고 두 번째 사람에게 비판을 요청하고 세 번째 사람에게 옵션을 제공하도록 요청했습니다. 모든 작업은 언제든지 중단할 수 있는 기능을 통해 하나의 창에서 음성으로 수행됩니다. 동일한 성도가 아래에 있습니다. 웹사이트용 음성 에이전트 — 거기에서 그는 또한 버튼을 누릅니다.

언어 모델 위에 음성 인터페이스를 구축하는 경우 참여 문제를 해결하고 중단 시 컨텍스트를 저장하는 방법에 대해 논의하는 것은 흥미로울 것입니다. 전화해 보세요: 신경 공간.pro/chat.

전이중 파이프라인: 연속 입력, 음성으로 스트리밍되는 토큰, 중단 시 재생 중단
전이중 파이프라인: 연속 입력, 음성으로 스트리밍되는 토큰, 중단 시 재생 중단

자주 묻는 질문(FAQ)

질문: 신경망에서 최상의 결과를 얻는 방법은 무엇입니까?
답변: 영어로 된 자세한 프롬프트(설명)를 사용하고 장면의 스타일과 세부 사항을 설정하세요.

질문: 이 자료를 상업적 목적으로 사용할 수 있나요?
답변: 예, 생성된 콘텐츠는 전적으로 귀하의 것입니다.