Ingyenes mesterséges intelligencia szövegfelolvasó: hangozhatja el szövegét egy neurális hálózaton keresztül a böngészőben
Mostantól ingyen hangoztathatja szövegét egy neurális hálózaton, és nincs mit telepítenie: a Szövegfelolvasó (ingyenes) modell megérkezett a Videó szakasz. Közvetlenül a böngészőben fut – írja be a szöveget, válasszon nyelvet és hangot, majd néhány másodperccel később meghallgatja és letölti a kész hangfájlt. Sem a szöveget, sem a hangfelvételt nem töltik fel sehova: minden a saját készülékén történik.

Miért ingyenes
A rendszeres beszédszolgáltatások szintetizálják a hangot a saját szervereiken, és pénzt vagy tokeneket számítanak fel érte. Itt a modell betöltődik a böngészőbe, és a számítógép grafikus kártyáját használja (WebGPU, a processzorral tartalékként). A szerver csak az eszköz kódját és a modellsúlyokat szolgálja ki – nincs mit kiszámolnia, így a tokeneket nem kell fizetni, a generációk száma pedig korlátlan.
Az adatvédelem is ingyenes: az Ön által hangoztatott szöveg és a hangfelvétel az eszközön marad. Ez akkor számít, ha üzeneteket, dokumentumokat vagy személyes megjegyzéseket ad ki.
Szöveg hangosítása neurális hálózattal: lépésről lépésre
- Nyissa meg a Videó szakasz és válogatni Szövegfelolvasó (ingyenes) a modelllistában – a legalsó helyen található, a többi ingyenes eszköz mellett.
- Illessze be a szöveget a „Szöveg hangra” mezőbe – egyszerre legfeljebb 2000 karakter.
- Válassza ki a nyelvet. Ha nem biztos benne, hagyja ki az „Automatikus észlelés” lehetőséget.
- Válasszon egy hangot: női vagy férfi, magasabb vagy alacsonyabb hangot, suttogást – vagy az egyik mentett hangot.
- Nyomja meg a "Beszéd generálása" gombot, és várja meg, amíg befejeződik. Az eredményt lejátszhatja az oldalon, és letöltheti WAV fájlként.
600+ nyelven
A modell többnyelvű: több mint 600 nyelvet ismer. Vegyes szövegek esetén bekapcsolva hagyhatja az automatikus nyelvészlelést, vagy kiválaszthatja a kívánt nyelvet – a listán angol, német, francia, spanyol, kínai, japán, arab és több tucat másik található, amelyek hasznosak, ha több országban is hangos videókat adsz meg.
Hogyan kell klónozni egy hangot
Kétféleképpen klónozhat hangot – mindkettő ingyenes, és mindkettőt az eszközön számítja ki:
- Tölts fel egy hangfájlt. MP3, WAV, M4A, OGG vagy WebM legfeljebb 30 másodpercig jól működik.
- Felvétel a mikrofonból. 10-20 másodpercnyi tiszta beszéd zene vagy zaj nélkül elegendő.
Az elemzés után az eszköz a felvételt hangprofillá alakítja, és eltárolja a böngészőjében. Innentől kezdve csak kiválaszthatja azt a hangot a listáról, és bármilyen szöveget a saját hangján szólaltathat meg anélkül, hogy újra feltöltené a felvételt. A profilokat helyben tartják, és túlélik az oldal újratöltését.
Mit kell tudni az első futás előtt
- Böngésző. A legfrissebb Chrome vagy Edge egy asztali számítógépen működik a legjobban. WebGPU nélkül a modell visszaesik a processzorhoz, és észrevehetően lassabb – az eszköz őszintén figyelmeztet erre.
- Első futás. A böngésző egyszer letölti a modellsúlyokat (körülbelül 3 GB), és gyorsítótárazza őket. A későbbi futások azonnal indulnak.
- Memória. Körülbelül 3 GB szabad memóriára van szükség. Gyenge eszközön az eszköz összeomlás helyett egyértelmű figyelmeztetést mutat.
- Eredmény. A kész fájl egy 24 kHz WAV, amely készen áll a szerkesztési idővonalra.
Kinek szól
A neurális szöveg a beszédre számos mindennapi feladatot lefed: klip megszólaltatása a közösségi médiában, egy cikk hangos változatának elkészítése, prezentáció narrációja, a forgatókönyv hangjának ellenőrzése, vagy egyszerűen egy dokumentum meghallgatása olvasás helyett. Ha egy adott személy hangjára van szüksége, klónozza azt egy rövid felvételről.
Ugyanebben a szakaszban vannak más ingyenes eszközök is, amelyek közvetlenül a böngészőben futnak: mélységi térkép, videó háttér eltávolító és videó és kép feljavító.
Gyakran ismételt kérdések
Tényleg ingyenes? Igen. Ehhez a modellhez nem kell tokeneket fizetni, és nincs fizetős API-ja – a számítógépe elvégzi a munkát.
Fel van töltve a szövegem? Nem. Sem a szöveg, sem a hang nem hagyja el a készüléket; csak az eszköz kódja és a modellsúlyok származnak a szerverről.
Mennyi ideig tart? Egy rövid kifejezés általában kevesebb mint egy percet vesz igénybe a modell egyszeri letöltése után; a hosszabb szöveg tovább tart, és a folyamatjelző sáv mutatja, hol van.