Indtalning av dialoger Gemini TTS: 30 röster och alla inställningar
I avsnittet "Audio" ett nytt verktyg har dykt upp - röstverkan av dialoger Gemini TTS. Det förvandlar det färdiga manuset till ljud: du anger talarna, deras röster och karaktär, och tjänsten läser upp raderna en efter en och returnerar den färdiga MP3.

Vad är detta för instrument
Det här är inte att läsa en text med en röst, utan en hel text dialog med flera talare. Varje karaktär får sin egen röst, accent, presentationsstil och tempo – och replikerna låter som de var tänkta: ett samtal mellan presentatörerna, en sketch, en intervju, repliker från karaktärerna till videon.
Två modeller tillgängliga:
- Gemini 3.8 Flash TTS — uttrycksfull röstskådespeleri: rikare känslor, mer naturlig rytm, bättre kontroll över leveransen. Lämplig för podcaster, ljudböcker, voice-overs.
- Gemini 3.8 Flash-Lite TTS — samma mekanik är billigare och snabbare: för stora volymer, utkast och högläsning av texter.
Vilka inställningar finns tillgängliga?
Gränssnittet visar alla parametrar som tillhandahålls av röstspelsmodellen:
- Talare. Från en till flera karaktärer; var och en har sin egen signatur "Speaker 1", "Speaker 2" och så vidare, genom vilken replikerna associeras med rösten.
- 30 röster - från mjukt berättande till energiskt och "nyheter".
- 8 accenter - neutral, amerikansk (allmän, "dal", sydlig), brittisk (RP och Brixton), transatlantisk, australisk.
- 6 serveringssätt — ett leende i rösten, en talare, en viskning, empati, promo och en "torr" jämn ton.
- 4 talhastigheter - naturlig, smattrande, slät "drift" och ryckig.
- Röstkaraktär - gratis beskrivning, som "varm berättare" eller "stern gatekeeper."
- Temperatur - från 0 till 2: lägre - mer stabil och förutsägbar, högre - livligare och mer varierad.
- Scen och allmän ton - en beskrivning av miljön ("ett tyst rum med en sprakande öppen spis") och berättarstilen ("en ljudbok, mjuk och inbjudande").
- Repliker — varje dialograd upp till 10 000 tecken; ordningen på replikerna är bevarad.
Hur man läser in dialog: steg för steg
- Öppna avsnittet "Ljud". och välj en modell Gemini 3.8 Flash TTS eller Flash-LiteTTS - de är längst ner på listan över modeller.
- Lägg till talare och anpassa varje persons röst, accent, stil och tempo.
- Skriv raderna i dialogen och identifiera talaren för var och en.
- Om så önskas, fyll i scenbeskrivningen, övergripande ton och temperatur.
- Titta på priset - det syns INNAN lansering och räknas om när du skriver in text.
- Klicka på "Voice" och när du är klar, lyssna på resultatet och ladda ner MP3.
Hur mycket kostar det
Priset beräknas baserat på den faktiska textvolymen: ju längre kopiorna är, desto högre blir kostnaden, och det är synligt före lansering - det finns inga överraskningar efter generation. Betalning görs med hjälp av webbplatstokens, som för andra betalda generationer; om det misslyckas returneras tokens automatiskt. Prisguiden kan ses direkt i formuläret: beloppet uppdateras medan du skriver skriptet.
Vanliga frågor
Kan jag läsa in en dialog mellan två eller flera karaktärer? Ja, varje talare har sin egen röst och inställningar, raderna avlöser varandra.
I vilket format är resultatet? MP3 - du kan lyssna på den på sidan och ladda ner den med en knapp.
Vilka språk talar modellen? Modellen är flerspråkig: den läser texter på dussintals språk, inklusive ryska och engelska.
Vad ska man välja: Flash eller Flash-Lite? För uttrycksfulla projekt - Flash, för stora volymer och utkast - Flash-Lite: mekaniken är densamma, men billigare och snabbare.
Måste jag betala för att prova? Avskrivningen sker när röstskådespeleriet startar, och om det finns ett fel returneras tokens automatiskt.