Sprachanruf an mehrere AIs gleichzeitig in einem Fenster: So tätigen Sie „Anruf Claude, GPT und DeepSeek“ mit Unterbrechung
Kurz zur Hauptsache (BLUF)
Es ist unbequem, die Antworten der Modelle einzeln zu vergleichen, und „Diktat“ ist noch kein Gespräch. Wir haben einen Sprachanruf getätigt, bei dem Claude, GPT und DeepSeek im selben Fenster antworten. Wir verraten Ihnen, wie sich ein Anruf von einem Diktat unterscheidet, wie die Architektur funktioniert und welche Fehler Sie gemacht haben.
In den meisten Chats mit KI sieht die Stimme so aus: Sie diktieren eine Nachricht, warten, lesen die Antwort. Dies ist kein Gespräch – dies ist ein Diktat. Wir sind dabei NeuralSpace im Abschnitt erledigt „Chatten“ vollwertig Sprachanruf: Sie sprechen, das Modell antwortet mit einer Stimme in Echtzeit, Sie können unterbrechen, und Sie können anrufen jedes Modell - Claude, GPT, DeepSeek – im selben Fenster. Zu verstehen, wie es funktioniert und warum, ist schwieriger als es scheint.
Warum „Diktat“ ≠ Gespräch
Eine Live-Konversation basiert auf zwei Dingen, die Push-to-Talk-Schnittstellen nicht bieten:
- Geringe Latenz. Eine Pause von 3-4 Sekunden zwischen Ihrer Bemerkung und der Antwort zerstört das Gefühl des Dialogs. Das Modell sollte fast sofort reagieren.
- Einmarsch. Bei Live-Ansprachen unterbrechen wir ständig: „Stopp, das ist es nicht“, „Kurz gesagt“, „Kannst du…“. Wenn ein Assistent seine langen Gedanken beendet und ignoriert, was Sie bereits sagen, ist dies kein Gesprächspartner, sondern ein Anrufbeantworter.
In beiden Punkten geht es um die Architektur von Streams und nicht um die „Verbindung der Sprachsynthese“.
Architektur

Vollduplex-Pfad. Das Mikrofon streamt kontinuierlich, die Erkennung erfolgt parallel zur Wiedergabe der Antwort. Wichtiger Punkt: Sobald der Sprachdetektor das erkennt Der Benutzer sprach, während das Modell antwortete, stoppt die Wiedergabe sofort, die unausgesprochene Antwort wird abgeschnitten und das, was das Model vor der Unterbrechung sagen konnte, wird richtig in den Kontext gesetzt – so dass sie versteht, wo sie unterbrochen wurde.
Modellunabhängig. Die interessanteste Lösung ist eine einzelne Sprachschicht über verschiedenen Modellen. Der Benutzer wechselt den Gesprächspartner in einem Fenster: Jetzt spricht er mit Claude, in einer Minute - mit GPT, dann mit DeepSeek. Hierzu der Vokaltrakt (Erkennung + Spracherkennung + Unterbrechungslogik + Synthese) von einem bestimmten Modell losgebunden: Das Modell ist das austauschbare „Gehirn“ hinter der gemeinsamen Sprachschnittstelle. Der Pfad arbeitet mit dem abstrakten Fluss „Replika → Antwort-Token-Fluss → Voiceover“ und weiß nicht, wer dahinter steckt.
Streamen Sie die Antwort in den Voiceover. Um nicht darauf warten zu müssen, dass das Modell die gesamte Antwort vervollständigt, werden Token bei ihrer Generierung in Blöcken entlang der Satzgrenzen synthetisiert. Dies führt zu einer geringen Verzögerung und macht das Unterbrechen natürlicher: Wir schneiden genau das ab, was bereits gesagt wurde.
Rechen
- Einbruch mit falschem Alarm. Husten, Hintergrundgeräusche, „uh-huh“ – das Model hört zur falschen Zeit auf zu reden. Wir mussten den Schwellenwert des Sprachdetektors kalibrieren, um die echte Nachbildung vom Rauschen zu unterscheiden.
- Kontext nach Unterbrechung. Wenn Sie eine unausgesprochene Antwort einfach wegwerfen, „vergisst“ das Modell, dass es überhaupt geantwortet hat. Wir speichern den gesprochenen Teil als seinen Verlauf im Dialog – dann funktioniert „Stopp, aber mehr zum Zweiten“ sinnvoll.
- Wechseln des Modells in einem Live-Gespräch. Die Geschichte des Dialogs ist ähnlich, aber die Modelle haben unterschiedliche Formate und „Charaktere“. Wir normalisieren die Geschichte, damit das neue Modell das Gespräch aufnimmt, anstatt bei Null anzufangen.
Warum ist das so?
Verschiedene Modelle sind auf unterschiedliche Weise stark: Das eine kann besser argumentieren, das andere ist kreativer, das andere ist schneller und billiger im Geschwätz. Ein Sprachanruf mit Vermittlung verwandelt dies in ein natürliches Szenario: Mit einem wird die Idee besprochen, der zweite wird gebeten, Kritik zu üben, und der dritte wird gebeten, Optionen zu nennen. Alles wird per Spracheingabe in einem Fenster erledigt, mit der Möglichkeit, jederzeit zu unterbrechen. Darunter liegt der gleiche Stimmapparat Sprachagent für Websites — da drückt er auch Knöpfe.
Wenn Sie Sprachschnittstellen auf der Grundlage von Sprachmodellen erstellen, ist es interessant zu diskutieren, wie Sie das Eingreifen lösen und den Kontext bei einem Defekt speichern. Rufen Sie an: neuralspace.pro/chat.

Häufig gestellte Fragen (FAQ)
Frage: Wie erzielt man mit einem neuronalen Netzwerk das beste Ergebnis?
Antwort: Verwenden Sie ausführliche Ansagen (Beschreibungen) auf Englisch, legen Sie den Stil und die Details der Szene fest.
Frage: Können diese Materialien kommerziell genutzt werden?
Antwort: Ja, der generierte Inhalt gehört vollständig Ihnen.