Llamada de voz a varias IA a la vez en una ventana: cómo hacer “llamada Claude, GPT y DeepSeek” con interrupción
Brevemente sobre lo principal (BLUF)
Es inconveniente comparar las respuestas de los modelos uno por uno y el "dictado" aún no es una conversación. Realizamos una llamada de voz donde Claude, GPT y DeepSeek responden en la misma ventana. Le diremos en qué se diferencia una llamada de un dictado, cómo funciona la arquitectura y qué errores ha cometido.
En la mayoría de los chats con IA, la voz se ve así: dictas un mensaje, esperas, lees la respuesta. Esto no es una conversación, es un dictado. estamos en Espacio neuronal hecho en la sección "Charlar" en toda regla llamada de voz: hablas, el modelo responde con una voz en tiempo real, puedes interrumpiry puedes llamar cualquier modelo - Claude, GPT, DeepSeek - en la misma ventana. Entender cómo funciona y por qué es más difícil de lo que parece.
Por qué “dictado” ≠ conversación
Una conversación en vivo se basa en dos cosas que las interfaces pulsar para hablar no tienen:
- Baja latencia. Una pausa de 3 a 4 segundos entre el comentario y la respuesta acaba con la sensación de diálogo. El modelo debería empezar a responder casi de inmediato.
- Intrusión. En el habla en vivo, interrumpimos constantemente: "basta, no es eso", "en resumen", "puedes...". Si un asistente termina su largo pensamiento, ignorando lo que ya estás diciendo, no es un interlocutor, es un contestador automático.
Ambos puntos tienen que ver con la arquitectura de las transmisiones y no con la “conexión de la síntesis de voz”.
Arquitectura

Ruta dúplex completa. El micrófono transmite continuamente, el reconocimiento se produce en paralelo con la reproducción de la respuesta. Punto clave: tan pronto como el detector de voz detecte eso el usuario habló mientras la modelo respondía, la reproducción se detiene inmediatamente, se corta la respuesta tácita y lo que la modelo logró decir antes de la interrupción se pone en contexto correctamente, para que comprenda dónde fue interrumpida.
Agnóstico del modelo. La solución más interesante es una única capa de voz sobre diferentes modelos. El usuario cambia de interlocutor en una ventana: ahora habla con Claude, en un minuto - con GPT, luego con DeepSeek. Para ello se utiliza el tracto vocal (reconocimiento + detección del habla + lógica de interrupción + síntesis) desatado de un modelo específico: El modelo es el “cerebro” reemplazable detrás de la interfaz de voz compartida. La ruta funciona con el flujo abstracto “réplica → flujo de token de respuesta → voz en off” y no sabe quién está detrás de él.
Transmitiendo la respuesta en voz en off. Para no esperar a que el modelo complete la respuesta completa, los tokens se sintetizan a medida que se generan, en fragmentos a lo largo de los límites de las oraciones. Esto produce un retraso reducido y hace que la interrupción sea natural: cortamos exactamente lo que ya se ha dicho.
Rastrillo
- Intrusión por falsa alarma. Tos, ruido de fondo, "ajá": el modelo deja de hablar en el momento equivocado. Tuvimos que calibrar el umbral del detector de voz para distinguir la réplica real del ruido.
- Contexto después de la interrupción. Si simplemente arroja una respuesta tácita, el modelo “olvida” que respondió por completo. Guardamos la parte hablada como su curso en el diálogo; luego "para, pero más sobre la segunda" funciona de manera significativa.
- Cambiando el modelo en una conversación en vivo. La historia del diálogo es común, pero los modelos tienen diferentes formatos y “personajes”. Estamos normalizando la historia para que el nuevo modelo retome la conversación en lugar de empezar desde cero.
¿Por qué es esto?
Los diferentes modelos son fuertes en diferentes aspectos: uno es mejor razonando, otro es más creativo, otro es más rápido y más barato para charlar. Una llamada de voz con conmutación convierte esto en un escenario natural: discutimos la idea con uno, le pedimos al segundo que criticara y al tercero que le diera opciones. Todo se hace por voz, en una sola ventana, con posibilidad de interrumpir en cualquier momento. El mismo tracto vocal se encuentra debajo agente de voz para sitios web — allí también presiona botones.
Si está creando interfaces de voz sobre modelos de lenguaje, es interesante analizar cómo resuelve la irrupción y el contexto de guardado cuando no funciona. Intenta llamar: neuralspace.pro/chat.

Preguntas frecuentes (FAQ)
Pregunta: ¿Cómo obtener el mejor resultado de una red neuronal?
Respuesta: Utilice indicaciones detalladas (descripciones) en inglés, establezca el estilo y los detalles de la escena.
Pregunta: ¿Se pueden utilizar estos materiales con fines comerciales?
Respuesta: Sí, el contenido generado es totalmente tuyo.