Recitazione vocale Gemini TTS: 30 voci e tutte le impostazioni
Nella sezione "Audio" è apparso un nuovo strumento - recitazione vocale dei dialoghi Gemini TTS. Trasforma la sceneggiatura finita in suono: specifichi gli relatori, le loro voci e il carattere, e il servizio esprime le battute una per una e restituisce il MP3 finito.

Che tipo di strumento è questo?
Non si tratta di leggere un testo con una sola voce, ma di leggerlo per intero dialogo a più parlanti. Ogni personaggio ha la propria voce, accento, stile di presentazione e ritmo - e le battute suonano come erano previste: una conversazione tra i presentatori, una scenetta, un'intervista, battute dei personaggi per il video.
Due modelli disponibili:
- Gemini 3.8 Flash TTS — recitazione vocale espressiva: emozioni più ricche, ritmo più naturale, controllo più preciso della consegna. Adatto per podcast, audiolibri, voci fuori campo.
- Gemini 3.8 Flash-Lite TTS — la stessa meccanica è più economica e veloce: per grandi volumi, bozze e lettura di testi ad alta voce.
Quali impostazioni sono disponibili?
L'interfaccia visualizza tutti i parametri forniti dal modello di recitazione vocale:
- Relatori. Da uno a più caratteri; ognuno ha la propria firma “Speaker 1”, “Speaker 2” e così via, con la quale le repliche sono associate alla voce.
- 30 voti - dalla narrativa morbida a quella energica e “notizia”.
- 8 accenti - neutrale, americano (generale, "valle", meridionale), britannico (RP e Brixton), transatlantico, australiano.
- 6 stili di servizio - un sorriso nella voce, un annunciatore, un sussurro, empatia, promo e un tono “secco” e uniforme.
- 4 velocità di parlato - naturale, picchiettio, liscio “deriva” e a scatti.
- Carattere vocale - descrizione libera, come "narratore caloroso" o "guardiano severo".
- Temperatura - da 0 a 2: più basso - più stabile e prevedibile, più alto - più vivace e vario.
- Scena e tono generale - una descrizione dell'ambientazione (“una stanza tranquilla con un caminetto scoppiettante”) e lo stile della narrazione (“un audiolibro, morbido e invitante”).
- Repliche — ciascuna riga di dialogo fino a 10.000 caratteri; l'ordine delle repliche è preservato.
Come dare voce al dialogo: passo dopo passo
- Aprire Sezione "Audio". e seleziona un modello Gemini 3.8 Flash TTS O Flash-LiteTTS - sono in fondo all'elenco dei modelli.
- Aggiungi relatori e personalizza la voce, l'accento, lo stile e il ritmo di ogni persona.
- Scrivi le battute del dialogo e identifica per ciascuna chi parla.
- Se lo si desidera, inserire la descrizione della scena, il tono generale e la temperatura.
- Guarda il prezzo: è visibile PRIMA del lancio e viene ricalcolato quando inserisci il testo.
- Fai clic su "Voce" e, quando sei pronto, ascolta il risultato e scarica MP3.
Quanto costa?
Il prezzo viene calcolato in base al volume effettivo del testo: più lunghe sono le repliche, maggiore è il costo ed è visibile prima del lancio, non ci sono sorprese dopo la generazione. Il pagamento viene effettuato utilizzando i token del sito, come per le altre generazioni a pagamento; in caso di esito negativo, i token vengono restituiti automaticamente. La guida ai prezzi può essere visualizzata direttamente nel modulo: l'importo viene aggiornato durante la digitazione dello script.
Domande frequenti
Posso doppiare i dialoghi tra due o più personaggi? Sì, ogni relatore ha la propria voce e le proprie impostazioni, le linee si alternano.
In che formato è il risultato? MP3 - puoi ascoltarlo sulla pagina e scaricarlo con un solo pulsante.
Quali lingue parla la modella? Il modello è multilingue: dà voce a testi in decine di lingue, tra cui russo e inglese.
Cosa scegliere: Flash o Flash-Lite? Per progetti espressivi - Flash, per grandi volumi e bozze - Flash-Lite: la meccanica è la stessa, ma più economica e veloce.
Devo pagare per provare? La cancellazione avviene quando inizia la recitazione vocale e, in caso di errore, i token vengono restituiti automaticamente.