Akting suara Gemini TTS: 30 suara dan semua pengaturan
Di bagian "Audio" alat baru telah muncul - akting suara dialog Gemini TTS. Ini mengubah skrip yang sudah selesai menjadi suara: Anda menentukan pembicara, suara dan karakternya, dan layanan menyuarakan baris satu per satu dan mengembalikan MP3 yang sudah selesai.

Instrumen macam apa ini
Ini bukan membaca satu teks dalam satu suara, tetapi secara lengkap dialog multi-pembicara. Setiap karakter mendapatkan suaranya, aksen, gaya presentasi, dan temponya sendiri - dan dialognya terdengar sesuai tujuannya: percakapan antara presenter, sandiwara, wawancara, dialog dari karakter untuk video.
Tersedia dua model:
- Gemini 3.8 Flash TTS — akting suara ekspresif: emosi yang lebih kaya, ritme yang lebih alami, kontrol penyampaian yang lebih baik. Cocok untuk podcast, buku audio, sulih suara.
- Gemini 3.8 Flash-Lite TTS — mekanisme yang sama lebih murah dan cepat: untuk volume besar, draf, dan membaca teks dengan suara keras.
Pengaturan apa yang tersedia?
Antarmuka menampilkan semua parameter yang disediakan oleh model akting suara:
- Pembicara. Dari satu hingga beberapa karakter; masing-masing memiliki tanda tangannya sendiri “Speaker 1”, “Speaker 2” dan seterusnya, yang dengannya replika dikaitkan dengan suara tersebut.
- 30 suara - dari narasi lembut hingga energik dan “berita”.
- 8 aksen - netral, Amerika (umum, "lembah", selatan), Inggris (RP dan Brixton), transatlantik, Australia.
- 6 gaya penyajian — senyuman dalam suaranya, penyiar, bisikan, empati, promo, dan nada datar yang “kering”.
- 4 kecepatan bicara - alami, derai, “melayang” halus dan tersentak-sentak.
- Karakter suara - deskripsi gratis, seperti “pendongeng yang hangat” atau “penjaga gerbang yang tegas”.
- Suhu - dari 0 hingga 2: lebih rendah - lebih stabil dan dapat diprediksi, lebih tinggi - lebih hidup dan bervariasi.
- Adegan dan nada umum - deskripsi latar (“ruangan yang tenang dengan perapian yang berderak”) dan gaya narasi (“buku audio, lembut dan mengundang”).
- Replika — setiap baris dialog hingga 10.000 karakter; urutan replika dipertahankan.
Cara menyuarakan dialog: langkah demi langkah
- Membuka Bagian "Audio". dan pilih model Gemini 3.8 Flash TTS atau Flash-LiteTTS - mereka berada di bagian bawah daftar model.
- Tambahkan speaker dan sesuaikan suara, aksen, gaya, dan tempo setiap orang.
- Tuliskan dialognya dan identifikasi pembicaranya.
- Jika diinginkan, isi deskripsi pemandangan, nada keseluruhan, dan suhu.
- Lihat harganya - terlihat SEBELUM peluncuran dan dihitung ulang saat Anda memasukkan teks.
- Klik “Voice” dan bila sudah siap, dengarkan hasilnya dan unduh MP3.
harganya berapa
Harga dihitung berdasarkan volume teks sebenarnya: semakin panjang replikanya, semakin tinggi biayanya, dan terlihat sebelum peluncuran - tidak ada kejutan setelah pembuatannya. Pembayaran dilakukan menggunakan token situs, seperti generasi berbayar lainnya; jika tidak berhasil, token dikembalikan secara otomatis. Panduan harga dapat dilihat langsung dalam bentuk: jumlah diperbarui saat Anda mengetik skrip.
Pertanyaan yang sering diajukan
Bisakah saya menyuarakan dialog antara dua karakter atau lebih? Ya, setiap speaker memiliki suara dan pengaturannya sendiri, garisnya bergantian.
Hasilnya dalam format apa? MP3 - Anda dapat mendengarkannya di halaman dan mengunduhnya dengan satu tombol.
Bahasa apa yang digunakan model? Modelnya multibahasa: menyuarakan teks dalam berbagai bahasa, termasuk Rusia dan Inggris.
Apa yang harus dipilih: Flash atau Flash-Lite? Untuk proyek ekspresif - Flash, untuk volume dan draf besar - Flash-Lite: mekanismenya sama, tetapi lebih murah dan lebih cepat.
Apakah saya harus membayar untuk mencoba? Penghapusan terjadi saat akting suara dimulai, dan jika terjadi kesalahan, token dikembalikan secara otomatis.