Panggilan suara ke beberapa AI sekaligus dalam satu jendela: cara melakukan "panggilan Claude, GPT, dan DeepSeek" dengan interupsi
Secara singkat tentang hal utama (BLUF)
Tidaklah nyaman untuk membandingkan jawaban model satu per satu, dan “dikte” belum menjadi perbincangan. Kami melakukan panggilan suara dimana Claude, GPT dan DeepSeek menjawab di jendela yang sama. Kami akan memberi tahu Anda perbedaan panggilan dengan dikte, cara kerja arsitektur, dan kesalahan apa yang Anda buat.
Di sebagian besar obrolan dengan AI, suaranya terlihat seperti ini: Anda mendiktekan pesan, tunggu, baca jawabannya. Ini bukan percakapan, ini dikte. Kami masukRuang Neuraldilakukan pada bagian tersebut"Mengobrol"penuhpanggilan suara: Anda berbicara, model merespons dengan suara secara real time, Anda bisamengganggu, dan Anda dapat meneleponmodel apa pun- Claude, GPT, DeepSeek - di jendela yang sama. Memahami cara kerjanya dan alasannya lebih sulit daripada yang terlihat.
Mengapa “dikte” ≠ percakapan
Percakapan langsung bergantung pada dua hal yang tidak dimiliki antarmuka push-to-talk:
- Latensi rendah.Jeda 3-4 detik antara komentar Anda dan jawaban mematikan perasaan dialog. Model akan segera merespons.
- Tongkang masuk.Dalam pidato langsung, kami terus-menerus menyela: “berhenti, bukan itu”, “singkatnya”, “bisakah…”. Jika asisten menyelesaikan pemikiran panjangnya, mengabaikan apa yang Anda katakan, ini bukan lawan bicara, ini mesin penjawab.
Kedua poin tersebut adalah tentang arsitektur aliran, dan bukan tentang “menghubungkan sintesis ucapan.”
Arsitektur

Jalur dupleks penuh.Mikrofon mengalir terus menerus, pengenalan terjadi bersamaan dengan pemutaran jawaban. Poin penting: segera setelah detektor ucapan menangkapnyapengguna berbicara saat model merespons, pemutaran segera dihentikan, jawaban yang tidak terucapkan terpotong, dan apa yang berhasil dikatakan model sebelum interupsi dimasukkan ke dalam konteks dengan benar - sehingga dia mengerti di mana dia diinterupsi.
Model agnostik.Solusi paling menarik adalah satu lapisan suara di atas model yang berbeda. Pengguna mengganti lawan bicaranya dalam satu jendela: sekarang dia berbicara dengan Claude, sebentar lagi - dengan GPT, lalu dengan DeepSeek. Untuk ini, saluran vokal (pengenalan + deteksi ucapan + logika interupsi + sintesis)terlepas dari model tertentu: Model adalah “otak” yang dapat diganti di balik antarmuka suara bersama. Jalur tersebut bekerja dengan aliran abstrak “replika → aliran token respons → sulih suara” dan tidak mengetahui siapa yang berada di baliknya.
Streaming jawabannya ke dalam sulih suara.Agar tidak menunggu model menyelesaikan seluruh jawaban, token dimasukkan ke dalam sintesis saat dihasilkan, dalam potongan-potongan di sepanjang batas kalimat. Hal ini memberikan penundaan yang rendah dan membuat interupsi menjadi alami: kita memotong persis apa yang telah dikatakan.
Menyapu
- Alarm palsu menerobos masuk.Batuk, kebisingan latar belakang, “uh-huh” - model berhenti berbicara pada waktu yang salah. Kami harus mengkalibrasi ambang batas detektor ucapan untuk membedakan replika asli dari kebisingan.
- Konteks setelah interupsi.Jika Anda hanya memberikan jawaban yang tidak terucapkan, model akan “lupa” bahwa jawabannya sama sekali. Kami menyimpan bagian yang diucapkan sebagai jalurnya dalam dialog - lalu “berhenti, tetapi lebih banyak tentang yang kedua” berfungsi dengan baik.
- Mengganti model dalam percakapan langsung.Sejarah dialognya umum, namun modelnya mempunyai format dan “karakter” yang berbeda. Kami menormalisasi sejarah sehingga model baru ini lebih menarik perhatian daripada memulai dari awal.
Mengapa ini?
Model yang berbeda memiliki kekuatan yang berbeda-beda: model yang satu lebih baik dalam berpikir, model yang lain lebih kreatif, model yang lain lebih cepat dan lebih murah untuk mengobrol. Panggilan suara dengan peralihan mengubah hal ini menjadi skenario alami: mendiskusikan ide dengan salah satu pihak, meminta pihak kedua untuk mengkritik, dan pihak ketiga memberikan pilihan. Semuanya dilakukan dengan suara, dalam satu jendela, dengan kemampuan menyela kapan saja. Saluran vokal yang sama terletak di bawahagen suara untuk situs web— di sana dia juga menekan tombol.
Jika Anda membangun antarmuka suara di atas model bahasa, menarik untuk mendiskusikan bagaimana Anda mengatasi masalah barge-in dan menyimpan konteks ketika rusak. Coba telepon:neuralspace.pro/chat.

Pertanyaan yang sering diajukan (FAQ)
Pertanyaan: Bagaimana cara mendapatkan hasil terbaik dari jaringan saraf?
Jawaban: Gunakan petunjuk rinci (deskripsi) dalam bahasa Inggris, atur gaya dan detail adegan.
Pertanyaan: Apakah bahan-bahan ini dapat digunakan untuk tujuan komersial?
Jawaban: Ya, konten yang dihasilkan sepenuhnya milik Anda.