Ozvučení dialogů Gemini TTS: 30 hlasů a všechna nastavení
V sekci "zvuk" objevil se nový nástroj - ozvučení dialogů Gemini TTS. Hotový skript přemění na zvuk: určíte mluvčí, jejich hlasy a charakter a služba vysloví řádky jeden po druhém a vrátí hotové MP3.

Co je to za nástroj
Nejedná se o čtení jednoho textu jedním hlasem, ale o celý text dialog s více mluvčími. Každá postava dostane svůj vlastní hlas, přízvuk, styl prezentace a tempo – a repliky znějí tak, jak byly zamýšleny: rozhovor mezi moderátory, scénka, rozhovor, repliky postav pro video.
K dispozici dva modely:
- Gemini 3.8 Flash TTS — expresivní hlasové herectví: bohatší emoce, přirozenější rytmus, jemnější kontrola přednesu. Vhodné pro podcasty, audioknihy, voice-overy.
- Gemini 3.8 Flash-Lite TTS — stejná mechanika je levnější a rychlejší: pro velké objemy, koncepty a čtení textů nahlas.
Jaká nastavení jsou k dispozici?
Rozhraní zobrazuje všechny parametry poskytované modelem hlasového ovládání:
- Mluvčí. Od jednoho do několika znaků; každý má svůj vlastní podpis „Speaker 1“, „Speaker 2“ a tak dále, kterým jsou repliky spojeny s hlasem.
- 30 hlasů - od jemného vyprávění po energické a „zprávy“.
- 8 akcentů - neutrální, americký (obecný, "údolí", jižní), britský (RP a Brixton), transatlantický, australský.
- 6 servírovacích stylů — úsměv v hlase, hlasatel, šepot, empatie, promo a „suchý“ rovnoměrný tón.
- 4 rychlosti řeči - přirozené, šustění, hladké "drift" a trhavé.
- Hlasový charakter - volný popis, například „vřelý vypravěč“ nebo „přísný strážce“.
- Teplota - od 0 do 2: nižší - stabilnější a předvídatelnější, vyšší - živější a rozmanitější.
- Scéna a celkový tón - popis prostředí („tichá místnost s praskajícím krbem“) a styl vyprávění („audiokniha, jemná a příjemná“).
- Repliky — každý řádek dialogu až 10 000 znaků; pořadí replik je zachováno.
Jak hlasový dialog: krok za krokem
- OTEVŘENO Sekce "Audio". a vyberte model Gemini 3.8 Flash TTS nebo Flash-LiteTTS - jsou na konci seznamu modelů.
- Přidejte mluvčí a přizpůsobte každému hlas, přízvuk, styl a tempo.
- Napište řádky dialogu a u každého určete mluvčího.
- V případě potřeby vyplňte popis scény, celkový tón a teplotu.
- Podívejte se na cenu – je viditelná PŘED spuštěním a přepočítává se při zadávání textu.
- Klikněte na „Voice“ a až budete připraveni, poslechněte si výsledek a stáhněte si MP3.
kolik to stojí
Cena se počítá na základě skutečného objemu textu: čím delší repliky, tím vyšší náklady a je to vidět před uvedením na trh – po vygenerování se nekoná žádná překvapení. Platba se provádí pomocí tokenů stránek, stejně jako u jiných placených generací; v případě neúspěchu jsou tokeny vráceny automaticky. Orientační ceny si můžete prohlédnout přímo ve formuláři: částka se aktualizuje během psaní skriptu.
Často kladené otázky
Mohu vyjádřit dialog mezi dvěma nebo více postavami? Ano, každý mluvčí má svůj hlas a nastavení, linky se střídají.
V jakém formátu je výsledek? MP3 - můžete si jej poslechnout na stránce a stáhnout jedním tlačítkem.
Jakými jazyky model mluví? Model je vícejazyčný: přenáší texty v desítkách jazyků, včetně ruštiny a angličtiny.
Co si vybrat: Flash nebo Flash-Lite? Pro expresivní projekty - Flash, pro velké objemy a návrhy - Flash-Lite: mechanika je stejná, ale levnější a rychlejší.
Musím za pokus zaplatit? K odepsání dojde, když začne hlasové vystupování, a pokud dojde k chybě, tokeny se automaticky vrátí.