Chamada de voz para várias IAs ao mesmo tempo em uma janela: como fazer “chamada Claude, GPT e DeepSeek” com interrupção
Resumidamente sobre o principal (BLUF)
É inconveniente comparar as respostas dos modelos uma por uma, e “ditado” ainda não é uma conversa. Fizemos uma chamada de voz onde Claude, GPT e DeepSeek atendem na mesma janela. Diremos a você como uma chamada difere de um ditado, como funciona a arquitetura e quais erros você cometeu.
Na maioria dos chats com IA, a voz fica assim: você dita uma mensagem, espera, lê a resposta. Isto não é uma conversa - é um ditado. Estamos em NeuralSpace feito na seção "Bater papo" completo chamada de voz: você fala, a modelo responde com voz em tempo real, você pode interromper, e você pode ligar qualquer modelo - Claude, GPT, DeepSeek - na mesma janela. Entender como funciona e por que é mais difícil do que parece.
Por que “ditado” ≠ conversa
Uma conversa ao vivo depende de duas coisas que as interfaces push-to-talk não possuem:
- Baixa latência. Uma pausa de 3-4 segundos entre o seu comentário e a resposta mata a sensação de diálogo. O modelo deve começar a responder quase imediatamente.
- Invadir. Na fala ao vivo, interrompemos constantemente: “para, não é isso”, “resumindo”, “você pode...”. Se um assistente termina sua longa reflexão, ignorando o que você já está dizendo, não é um interlocutor, é uma secretária eletrônica.
Ambos os pontos são sobre a arquitetura dos fluxos, e não sobre “conectar a síntese de fala”.
Arquitetura

Caminho duplex completo. O microfone transmite continuamente, o reconhecimento ocorre paralelamente à reprodução da resposta. Ponto-chave: assim que o detector de fala detectar isso o usuário falou enquanto a modelo respondia, a reprodução para imediatamente, a resposta não dita é cortada e o que a modelo conseguiu dizer antes da interrupção é contextualizado corretamente - para que ela entenda onde foi interrompida.
Modelo agnóstico. A solução mais interessante é uma única camada de voz sobre diferentes modelos. O usuário troca o interlocutor em uma janela: agora ele fala com Claude, em um minuto - com GPT, depois com DeepSeek. Para isso, é utilizado o trato vocal (reconhecimento + detecção de fala + lógica de interrupção + síntese) desamarrado de um modelo específico: O modelo é o “cérebro” substituível por trás da interface de voz compartilhada. O caminho funciona com o fluxo abstrato “réplica → fluxo do token de resposta → narração” e não sabe quem está por trás dele.
Transmitindo a resposta para narração. Para não esperar que o modelo complete toda a resposta, os tokens entram em síntese à medida que são gerados, em pedaços ao longo dos limites das sentenças. Isso proporciona um atraso baixo e torna a interrupção natural: cortamos exatamente o que já foi dito.
Ancinho
- Intrusão de alarme falso. Tosse, ruído de fundo, “uh-huh” - a modelo para de falar na hora errada. Tivemos que calibrar o limiar do detector de fala para distinguir a réplica real do ruído.
- Contexto após interrupção. Se você simplesmente der uma resposta tácita, o modelo “esquece” que respondeu. Salvamos a parte falada como seu curso no diálogo - então “pare, mas mais sobre o segundo” funciona de forma significativa.
- Trocando o modelo em uma conversa ao vivo. A história do diálogo é comum, mas os modelos possuem formatos e “personagens” diferentes. Estamos normalizando a história para que o novo modelo retome a conversa em vez de começar do zero.
Por que isso é
Diferentes modelos são fortes de diferentes maneiras: um é melhor no raciocínio, outro é mais criativo, outro é mais rápido e mais barato para conversar. Uma chamada de voz com switching transforma isso em um cenário natural: discutimos a ideia com um, pedimos ao segundo que criticasse e ao terceiro que desse opções. Tudo é feito por voz, em uma janela, podendo ser interrompido a qualquer momento. O mesmo trato vocal está sob agente de voz para sites — lá ele também aperta botões.
Se você estiver construindo interfaces de voz com base em modelos de linguagem, é interessante discutir como você resolve a invasão e salva o contexto quando quebrado. Tente ligar: neuralspace.pro/chat.

Perguntas frequentes (FAQ)
Pergunta: Como obter o melhor resultado de uma rede neural?
Resposta: Use instruções detalhadas (descrições) em inglês, defina o estilo e os detalhes da cena.
Question: Esses materiais podem ser usados para fins comerciais?
Resposta: Sim, o conteúdo gerado é inteiramente seu.