← Все статьи

Ozvučení dialogů Gemini TTS: 30 hlasů a všechna nastavení

Světlé nahrávací studio u okna: dva mikrofony, sluchátka a barevné zvukové vlny, měkké plovoucí karty s dialogovými linkami, hodně světla

V sekci "zvuk" objevil se nový nástroj - ozvučení dialogů Gemini TTS. Hotový skript přemění na zvuk: určíte mluvčí, jejich hlasy a charakter a služba vysloví řádky jeden po druhém a vrátí hotové MP3.

Zvuková sekce: hlasový nástroj Gemini TTS se dvěma nakonfigurovanými mluvčí, dialogovými řádky, posuvníkem teploty a cenou zobrazenou před spuštěním

Co je to za nástroj

Nejedná se o čtení jednoho textu jedním hlasem, ale o celý text dialog s více mluvčími. Každá postava dostane svůj vlastní hlas, přízvuk, styl prezentace a tempo – a repliky znějí tak, jak byly zamýšleny: rozhovor mezi moderátory, scénka, rozhovor, repliky postav pro video.

K dispozici dva modely:

  • Gemini 3.8 Flash TTS — expresivní hlasové herectví: bohatší emoce, přirozenější rytmus, jemnější kontrola přednesu. Vhodné pro podcasty, audioknihy, voice-overy.
  • Gemini 3.8 Flash-Lite TTS — stejná mechanika je levnější a rychlejší: pro velké objemy, koncepty a čtení textů nahlas.

Jaká nastavení jsou k dispozici?

Rozhraní zobrazuje všechny parametry poskytované modelem hlasového ovládání:

  • Mluvčí. Od jednoho do několika znaků; každý má svůj vlastní podpis „Speaker 1“, „Speaker 2“ a tak dále, kterým jsou repliky spojeny s hlasem.
  • 30 hlasů - od jemného vyprávění po energické a „zprávy“.
  • 8 akcentů - neutrální, americký (obecný, "údolí", jižní), britský (RP a Brixton), transatlantický, australský.
  • 6 servírovacích stylů — úsměv v hlase, hlasatel, šepot, empatie, promo a „suchý“ rovnoměrný tón.
  • 4 rychlosti řeči - přirozené, šustění, hladké "drift" a trhavé.
  • Hlasový charakter - volný popis, například „vřelý vypravěč“ nebo „přísný strážce“.
  • Teplota - od 0 do 2: nižší - stabilnější a předvídatelnější, vyšší - živější a rozmanitější.
  • Scéna a celkový tón - popis prostředí („tichá místnost s praskajícím krbem“) a styl vyprávění („audiokniha, jemná a příjemná“).
  • Repliky — každý řádek dialogu až 10 000 znaků; pořadí replik je zachováno.

Jak hlasový dialog: krok za krokem

  1. OTEVŘENO Sekce "Audio". a vyberte model Gemini 3.8 Flash TTS nebo Flash-LiteTTS - jsou na konci seznamu modelů.
  2. Přidejte mluvčí a přizpůsobte každému hlas, přízvuk, styl a tempo.
  3. Napište řádky dialogu a u každého určete mluvčího.
  4. V případě potřeby vyplňte popis scény, celkový tón a teplotu.
  5. Podívejte se na cenu – je viditelná PŘED spuštěním a přepočítává se při zadávání textu.
  6. Klikněte na „Voice“ a až budete připraveni, poslechněte si výsledek a stáhněte si MP3.

kolik to stojí

Cena se počítá na základě skutečného objemu textu: čím delší repliky, tím vyšší náklady a je to vidět před uvedením na trh – po vygenerování se nekoná žádná překvapení. Platba se provádí pomocí tokenů stránek, stejně jako u jiných placených generací; v případě neúspěchu jsou tokeny vráceny automaticky. Orientační ceny si můžete prohlédnout přímo ve formuláři: částka se aktualizuje během psaní skriptu.

Často kladené otázky

Mohu vyjádřit dialog mezi dvěma nebo více postavami? Ano, každý mluvčí má svůj hlas a nastavení, linky se střídají.

V jakém formátu je výsledek? MP3 - můžete si jej poslechnout na stránce a stáhnout jedním tlačítkem.

Jakými jazyky model mluví? Model je vícejazyčný: přenáší texty v desítkách jazyků, včetně ruštiny a angličtiny.

Co si vybrat: Flash nebo Flash-Lite? Pro expresivní projekty - Flash, pro velké objemy a návrhy - Flash-Lite: mechanika je stejná, ale levnější a rychlejší.

Musím za pokus zaplatit? K odepsání dojde, když začne hlasové vystupování, a pokud dojde k chybě, tokeny se automaticky vrátí.