← Todos os artigos

Chamada de voz para várias IAs ao mesmo tempo em uma janela: como fazer “chamada Claude, GPT e DeepSeek” com interrupção

Chamada de voz para vários AIs ao mesmo tempo em uma janela: como fazer “chamada Claude, GPT e DeepSeek” com interrupção

Resumidamente sobre o principal (BLUF)

É inconveniente comparar as respostas dos modelos uma por uma, e “ditado” ainda não é uma conversa. Fizemos uma chamada de voz onde Claude, GPT e DeepSeek atendem na mesma janela. Diremos a você como uma chamada difere de um ditado, como funciona a arquitetura e quais erros você cometeu.

Na maioria dos chats com IA, a voz fica assim: você dita uma mensagem, espera, lê a resposta. Isto não é uma conversa - é um ditado. Estamos em NeuralSpace feito na seção "Bater papo" completo chamada de voz: você fala, a modelo responde com voz em tempo real, você pode interromper, e você pode ligar qualquer modelo - Claude, GPT, DeepSeek - na mesma janela. Entender como funciona e por que é mais difícil do que parece.

Por que “ditado” ≠ conversa

Uma conversa ao vivo depende de duas coisas que as interfaces push-to-talk não possuem:

  1. Baixa latência. Uma pausa de 3-4 segundos entre o seu comentário e a resposta mata a sensação de diálogo. O modelo deve começar a responder quase imediatamente.
  2. Invadir. Na fala ao vivo, interrompemos constantemente: “para, não é isso”, “resumindo”, “você pode...”. Se um assistente termina sua longa reflexão, ignorando o que você já está dizendo, não é um interlocutor, é uma secretária eletrônica.

Ambos os pontos são sobre a arquitetura dos fluxos, e não sobre “conectar a síntese de fala”.

Arquitetura

Caminho full-duplex: entrada contínua, streaming de tokens em narração, interrupção da resposta ao interromper
Caminho full-duplex: entrada contínua, streaming de tokens em narração, interrupção da resposta ao interromper

Caminho duplex completo. O microfone transmite continuamente, o reconhecimento ocorre paralelamente à reprodução da resposta. Ponto-chave: assim que o detector de fala detectar isso o usuário falou enquanto a modelo respondia, a reprodução para imediatamente, a resposta não dita é cortada e o que a modelo conseguiu dizer antes da interrupção é contextualizado corretamente - para que ela entenda onde foi interrompida.

Modelo agnóstico. A solução mais interessante é uma única camada de voz sobre diferentes modelos. O usuário troca o interlocutor em uma janela: agora ele fala com Claude, em um minuto - com GPT, depois com DeepSeek. Para isso, é utilizado o trato vocal (reconhecimento + detecção de fala + lógica de interrupção + síntese) desamarrado de um modelo específico: O modelo é o “cérebro” substituível por trás da interface de voz compartilhada. O caminho funciona com o fluxo abstrato “réplica → fluxo do token de resposta → narração” e não sabe quem está por trás dele.

Transmitindo a resposta para narração. Para não esperar que o modelo complete toda a resposta, os tokens entram em síntese à medida que são gerados, em pedaços ao longo dos limites das sentenças. Isso proporciona um atraso baixo e torna a interrupção natural: cortamos exatamente o que já foi dito.

Ancinho

  • Intrusão de alarme falso. Tosse, ruído de fundo, “uh-huh” - a modelo para de falar na hora errada. Tivemos que calibrar o limiar do detector de fala para distinguir a réplica real do ruído.
  • Contexto após interrupção. Se você simplesmente der uma resposta tácita, o modelo “esquece” que respondeu. Salvamos a parte falada como seu curso no diálogo - então “pare, mas mais sobre o segundo” funciona de forma significativa.
  • Trocando o modelo em uma conversa ao vivo. A história do diálogo é comum, mas os modelos possuem formatos e “personagens” diferentes. Estamos normalizando a história para que o novo modelo retome a conversa em vez de começar do zero.

Por que isso é

Diferentes modelos são fortes de diferentes maneiras: um é melhor no raciocínio, outro é mais criativo, outro é mais rápido e mais barato para conversar. Uma chamada de voz com switching transforma isso em um cenário natural: discutimos a ideia com um, pedimos ao segundo que criticasse e ao terceiro que desse opções. Tudo é feito por voz, em uma janela, podendo ser interrompido a qualquer momento. O mesmo trato vocal está sob agente de voz para sites — lá ele também aperta botões.

Se você estiver construindo interfaces de voz com base em modelos de linguagem, é interessante discutir como você resolve a invasão e salva o contexto quando quebrado. Tente ligar: neuralspace.pro/chat.

Pipeline full-duplex: entrada contínua, tokens transmitidos para fala, reprodução cortada em caso de interrupção
Pipeline full-duplex: entrada contínua, tokens transmitidos para fala, reprodução cortada em caso de interrupção

Perguntas frequentes (FAQ)

Pergunta: Como obter o melhor resultado de uma rede neural?
Resposta: Use instruções detalhadas (descrições) em inglês, defina o estilo e os detalhes da cena.

Question: Esses materiais podem ser usados ​​para fins comerciais?
Resposta: Sim, o conteúdo gerado é inteiramente seu.