← Összes cikk

Párbeszédek megszólaltatása a Gemini TTS-sel: 30 hang és minden beállítás

Világos hangstúdió az ablak mellett: két mikrofon, fejhallgató és színes hanghullámok, lágy lebegő kártyák párbeszédes vonalakkal, sok fény

A szakaszban "Hang" egy új eszköz jelent meg - párbeszédek megszólaltatása Gemini TTS. A kész forgatókönyvet hanggá alakítja: megadod a beszélőket, azok hangját és karakterét, a szolgáltatás pedig egyenként szólaltatja meg a sorokat, és a kész MP3-t adja vissza.

Audio szekció: a Gemini TTS beszélő eszköz két konfigurált beszélővel, párbeszédsorokkal, hőmérsékletcsúszkával és az indulás előtt megjelenő árral

Milyen hangszer ez

Ez nem egy szöveg egyhangú felolvasása, hanem egy teljes szöveg több beszélős párbeszéd. Minden karakter megkapja a saját hangját, akcentusát, előadásmódját és tempóját – a sorok pedig úgy hangzanak, ahogyan eltervezték: beszélgetés a műsorvezetők között, összefoglaló, interjú, sorok a szereplőktől a videóhoz.

Két modell kapható:

  • Gemini 3.8 Flash TTS — expresszív hangjáték: gazdagabb érzelmek, természetesebb ritmus, finomabb kézbesítési kontroll. Alkalmas podcastokhoz, hangoskönyvekhez, beszédhangokhoz.
  • Gemini 3.8 Flash-Lite TTS — ugyanaz a mechanika olcsóbb és gyorsabb: nagy kötetek, piszkozatok és szövegek hangos felolvasása esetén.

Milyen beállítások érhetők el?

Az interfész megjeleníti a hangalapú modell által biztosított összes paramétert:

  • Beszélők. Egytől több karakterig; mindegyiknek saját aláírása van: „Speaker 1”, „Speaker 2” és így tovább, amellyel a replikákat a hanghoz társítják.
  • 30 szavazat - a lágy narratívától az energikusig és a „hírekig”.
  • 8 ékezetes - semleges, amerikai (általános, "völgy", déli), brit (RP és Brixton), transzatlanti, ausztrál.
  • 6 tálalási mód — mosoly a hangban, bemondó, suttogás, empátia, promóció és „száraz” egyenletes hangnem.
  • 4 beszédsebesség - természetes, mintás, sima „drift” és szaggatott.
  • Hang karakter - ingyenes leírás, például „meleg mesemondó” vagy „szigorú kapuőr”.
  • Hőmérséklet - 0-tól 2-ig: alacsonyabb - stabilabb és kiszámíthatóbb, magasabb - élénkebb és változatosabb.
  • Jelenet és általános hangnem - a környezet leírása („csendes szoba pattogó kandallóval”) és a narráció stílusa („hangoskönyv, puha és hívogató”).
  • Replikák — minden párbeszédsor legfeljebb 10 000 karakterig; a replikák sorrendje megmarad.

A párbeszéd hangosítása: lépésről lépésre

  1. Nyitott "Hang" szakasz és válasszon egy modellt Gemini 3.8 Flash TTS vagy Flash-LiteTTS - a modellek listájának alján vannak.
  2. Adjon hozzá beszélőket, és szabja testre az egyes személyek hangját, akcentusát, stílusát és tempóját.
  3. Írja le a párbeszéd sorait, és mindegyikhez azonosítsa a beszélőt.
  4. Ha szükséges, töltse ki a jelenet leírását, az általános hangszínt és a hőmérsékletet.
  5. Nézze meg az árat – az indítás ELŐTT látható, és a szöveg beírásakor újraszámításra kerül.
  6. Kattintson a „Hang” elemre, és ha kész, hallgassa meg az eredményt, és töltse le a MP3 fájlt.

Mennyibe kerül

Az árat a szöveg tényleges mennyisége alapján számítják ki: minél hosszabbak a replikák, annál magasabbak a költségek, és az indulás előtt is látható – generálás után nincs meglepetés. A fizetés a webhely tokenek használatával történik, mint a többi fizetett generáció esetében; sikertelenség esetén a tokenek automatikusan visszaküldésre kerülnek. Az árkalauz közvetlenül az űrlapon tekinthető meg: az összeg a szkript beírása közben frissül.

Gyakran ismételt kérdések

Lejátszhatom a párbeszédet két vagy több karakter között? Igen, minden beszélőnak megvan a saját hangja és beállításai, a vonalak váltják egymást.

Milyen formában van az eredmény? MP3 - meghallgathatja az oldalon, és egy gombbal letöltheti.

Milyen nyelveket beszél a modell? A modell többnyelvű: több tucat nyelven szólaltat meg szövegeket, köztük oroszul és angolul is.

Mit válasszunk: Flash vagy Flash-Lite? Kifejező projektekhez - Flash, nagy mennyiségekhez és piszkozatokhoz - Flash-Lite: a mechanika ugyanaz, de olcsóbb és gyorsabb.

Fizetnem kell a kipróbálásért? A leírás akkor történik, amikor a hangvezérlés elindul, és ha hiba történik, a tokenek automatikusan visszaküldésre kerülnek.