← Tutti gli articoli

Recitazione vocale Gemini TTS: 30 voci e tutte le impostazioni

Uno studio di registrazione luminoso vicino alla finestra: due microfoni, cuffie e onde sonore colorate, morbide carte fluttuanti con linee di dialogo, tanta luce

Nella sezione "Audio" è apparso un nuovo strumento - recitazione vocale dei dialoghi Gemini TTS. Trasforma la sceneggiatura finita in suono: specifichi gli relatori, le loro voci e il carattere, e il servizio esprime le battute una per una e restituisce il MP3 finito.

Sezione audio: lo strumento voiceover Gemini TTS con due relatori configurati, linee di dialogo, il cursore della temperatura e il prezzo mostrato prima di iniziare

Che tipo di strumento è questo?

Non si tratta di leggere un testo con una sola voce, ma di leggerlo per intero dialogo a più parlanti. Ogni personaggio ha la propria voce, accento, stile di presentazione e ritmo - e le battute suonano come erano previste: una conversazione tra i presentatori, una scenetta, un'intervista, battute dei personaggi per il video.

Due modelli disponibili:

  • Gemini 3.8 Flash TTS — recitazione vocale espressiva: emozioni più ricche, ritmo più naturale, controllo più preciso della consegna. Adatto per podcast, audiolibri, voci fuori campo.
  • Gemini 3.8 Flash-Lite TTS — la stessa meccanica è più economica e veloce: per grandi volumi, bozze e lettura di testi ad alta voce.

Quali impostazioni sono disponibili?

L'interfaccia visualizza tutti i parametri forniti dal modello di recitazione vocale:

  • Relatori. Da uno a più caratteri; ognuno ha la propria firma “Speaker 1”, “Speaker 2” e così via, con la quale le repliche sono associate alla voce.
  • 30 voti - dalla narrativa morbida a quella energica e “notizia”.
  • 8 accenti - neutrale, americano (generale, "valle", meridionale), britannico (RP e Brixton), transatlantico, australiano.
  • 6 stili di servizio - un sorriso nella voce, un annunciatore, un sussurro, empatia, promo e un tono “secco” e uniforme.
  • 4 velocità di parlato - naturale, picchiettio, liscio “deriva” e a scatti.
  • Carattere vocale - descrizione libera, come "narratore caloroso" o "guardiano severo".
  • Temperatura - da 0 a 2: più basso - più stabile e prevedibile, più alto - più vivace e vario.
  • Scena e tono generale - una descrizione dell'ambientazione (“una stanza tranquilla con un caminetto scoppiettante”) e lo stile della narrazione (“un audiolibro, morbido e invitante”).
  • Repliche — ciascuna riga di dialogo fino a 10.000 caratteri; l'ordine delle repliche è preservato.

Come dare voce al dialogo: passo dopo passo

  1. Aprire Sezione "Audio". e seleziona un modello Gemini 3.8 Flash TTS O Flash-LiteTTS - sono in fondo all'elenco dei modelli.
  2. Aggiungi relatori e personalizza la voce, l'accento, lo stile e il ritmo di ogni persona.
  3. Scrivi le battute del dialogo e identifica per ciascuna chi parla.
  4. Se lo si desidera, inserire la descrizione della scena, il tono generale e la temperatura.
  5. Guarda il prezzo: è visibile PRIMA del lancio e viene ricalcolato quando inserisci il testo.
  6. Fai clic su "Voce" e, quando sei pronto, ascolta il risultato e scarica MP3.

Quanto costa?

Il prezzo viene calcolato in base al volume effettivo del testo: più lunghe sono le repliche, maggiore è il costo ed è visibile prima del lancio, non ci sono sorprese dopo la generazione. Il pagamento viene effettuato utilizzando i token del sito, come per le altre generazioni a pagamento; in caso di esito negativo, i token vengono restituiti automaticamente. La guida ai prezzi può essere visualizzata direttamente nel modulo: l'importo viene aggiornato durante la digitazione dello script.

Domande frequenti

Posso doppiare i dialoghi tra due o più personaggi? Sì, ogni relatore ha la propria voce e le proprie impostazioni, le linee si alternano.

In che formato è il risultato? MP3 - puoi ascoltarlo sulla pagina e scaricarlo con un solo pulsante.

Quali lingue parla la modella? Il modello è multilingue: dà voce a testi in decine di lingue, tra cui russo e inglese.

Cosa scegliere: Flash o Flash-Lite? Per progetti espressivi - Flash, per grandi volumi e bozze - Flash-Lite: la meccanica è la stessa, ma più economica e veloce.

Devo pagare per provare? La cancellazione avviene quando inizia la recitazione vocale e, in caso di errore, i token vengono restituiti automaticamente.