Indtaling af dialoger med Gemini TTS: 30 stemmer og alle indstillinger
I afsnittet "Lyd" et nyt værktøj er dukket op - stemmehandling af dialoger Gemini TTS. Det forvandler det færdige manuskript til lyd: du angiver talerne, deres stemmer og karakter, og tjenesten oplæser linjerne én efter én og returnerer den færdige MP3.

Hvad er det for et instrument
Dette er ikke at læse én tekst med én stemme, men en hel tekst dialog med flere talere. Hver karakter får sin egen stemme, accent, præsentationsstil og tempo – og replikkerne lyder, som de var tiltænkt: en samtale mellem oplægsholderne, et sketch, et interview, replikker fra karaktererne til videoen.
To modeller tilgængelige:
- Gemini 3.8 Flash TTS — udtryksfuld stemmeføring: rigere følelser, mere naturlig rytme, finere kontrol med leveringen. Velegnet til podcasts, lydbøger, voice-overs.
- Gemini 3.8 Flash-Lite TTS — den samme mekanik er billigere og hurtigere: til store mængder, kladder og oplæsning af tekster.
Hvilke indstillinger er tilgængelige?
Grænsefladen viser alle de parametre, der leveres af indtalinglermodellen:
- Talere. Fra én til flere karakterer; hver har sin egen signatur "Speaker 1", "Speaker 2" og så videre, hvorved replikaerne er forbundet med stemmen.
- 30 stemmer - fra blød fortælling til energisk og "nyhed".
- 8 accenter - neutral, amerikansk (generelt, "dal", sydlig), britisk (RP og Brixton), transatlantisk, australsk.
- 6 serveringsstile - et smil i stemmen, en taler, en hvisken, empati, promo og en "tør" jævn tone.
- 4 talehastigheder - naturlig, klapper, glat "drift" og ryk.
- Stemmekarakter - gratis beskrivelse, såsom "varm historiefortæller" eller "stern gatekeeper."
- Temperatur - fra 0 til 2: lavere - mere stabil og forudsigelig, højere - livligere og mere varieret.
- Scene og generel tone - en beskrivelse af rammerne ("et stille rum med en knitrende pejs") og fortællestilen ("en lydbog, blød og indbydende").
- Replikaer — hver dialoglinje op til 10.000 tegn; replikernes rækkefølge er bevaret.
Sådan tales dialog: trin for trin
- Åben "Lyd" sektionen og vælg en model Gemini 3.8 Flash TTS eller Flash-LiteTTS - de er nederst på listen over modeller.
- Tilføj talere og tilpas hver persons stemme, accent, stil og tempo.
- Skriv dialoglinjerne og identificer taleren for hver.
- Hvis det ønskes, udfyld scenebeskrivelsen, overordnet tone og temperatur.
- Se på prisen - den er synlig FØR lancering og genberegnes efterhånden som du indtaster tekst.
- Klik på "Voice", og når du er klar, lyt til resultatet og download MP3.
Hvor meget koster det
Prisen beregnes ud fra den faktiske mængde tekst: Jo længere replikaerne er, desto højere omkostninger, og den er synlig før lancering - der er ingen overraskelser efter generation. Betaling foretages ved hjælp af site-tokens, som for andre betalte generationer; hvis det ikke lykkes, returneres tokens automatisk. Prisguiden kan ses direkte i formularen: Beløbet opdateres, mens du skriver scriptet.
Ofte stillede spørgsmål
Kan jeg indtale en dialog mellem to eller flere karakterer? Ja, hver taler har sin egen stemme og indstillinger, linjerne skiftes til.
I hvilket format er resultatet? MP3 - du kan lytte til den på siden og downloade den med én knap.
Hvilke sprog taler modellen? Modellen er flersproget: den indtaler tekster på snesevis af sprog, herunder russisk og engelsk.
Hvad skal man vælge: Flash eller Flash-Lite? Til udtryksfulde projekter - Flash, til store mængder og udkast - Flash-Lite: mekanikken er den samme, men billigere og hurtigere.
Skal jeg betale for at prøve? Afskrivningen sker, når stemmehandling starter, og hvis der er en fejl, returneres tokens automatisk.