← Alla artiklar

AI Text to Speech Free: Rösta din text med ett neuralt nätverk i din webbläsare

Ljus studio: en mikrofon och levande ljudvågor — neural text till tal direkt i webbläsaren

Du kan nu rösta din text med ett neuralt nätverk gratis, utan något att installera: Text till tal (gratis) modellen har anlänt i Video avsnitt. Den körs direkt i din webbläsare - skriv texten, välj ett språk och en röst, och några sekunder senare lyssnar du på och laddar ner den färdiga ljudfilen. Varken texten eller röstinspelningen laddas upp någonstans: allt beräknas på din egen enhet.

Videosektion: Text till tal-modellen (gratis) vald längst ned i listan, med text-, språk- och röstfält

Varför det är gratis

Vanliga taltjänster syntetiserar ljud på sina egna servrar och tar ut pengar eller tokens för det. Här laddas modellen in i webbläsaren och använder din dators grafikkort (WebGPU, med processorn som reserv). Servern serverar bara verktygets kod och modellvikterna — den har inget att beräkna, så inga tokens debiteras och antalet generationer är obegränsat.

Sekretess är också gratis: texten du röstar och din röstinspelning stannar på din enhet. Det spelar roll när du röstar meddelanden, dokument eller personliga anteckningar.

Hur man röstar text med ett neuralt nätverk: steg för steg

  1. Öppna Videosektion och plocka Text till tal (gratis) i modelllistan — den sitter längst ner, bredvid de andra gratisverktygen.
  2. Klistra in din text i fältet "Text till röst" - upp till 2000 tecken åt gången.
  3. Välj språk. Om du inte är säker, lämna "Detektera automatiskt".
  4. Välj en röst: kvinnlig eller manlig, högre eller lägre, en viskning - eller en av dina sparade röster.
  5. Tryck på "Generera tal" och vänta tills det är klart. Du kan spela upp resultatet på sidan och ladda ner det som en WAV-fil.

600+ språk

Modellen är flerspråkig: den kan mer än 600 språk. För blandad text kan du lämna automatisk språkidentifiering på eller välja det språk du behöver - listan innehåller engelska, tyska, franska, spanska, kinesiska, japanska, arabiska och dussintals mer, praktiskt när du röstar videor för flera länder.

Hur man klona en röst

Du kan klona en röst på två sätt – båda är gratis och båda beräknas på din enhet:

  • Ladda upp en ljudfil. MP3, WAV, M4A, OGG eller WebM upp till 30 sekunder fungerar bra.
  • Spela in från din mikrofon. 10–20 sekunders rent tal utan musik eller brus räcker.

Efter analysen förvandlar verktyget inspelningen till en röstprofil och lagrar den i din webbläsare. Från och med då väljer du bara den rösten från listan och röstar vilken text som helst med din egen röst utan att ladda upp inspelningen igen. Profilerna hålls lokalt och överlever en omladdning av sidan.

Vad du ska veta innan första körningen

  • Webbläsare. En ny Chrome eller Edge på ett skrivbord fungerar bäst. Utan WebGPU faller modellen tillbaka till processorn och är märkbart långsammare — verktyget varnar dig ärligt för det.
  • Första löpningen. Webbläsaren laddar ner modellvikterna en gång (cirka 3 GB) och cachar dem. Senare körningar startar omedelbart.
  • Minne. Cirka 3 GB ledigt minne behövs. På en svag enhet visar verktyget en tydlig varning istället för att krascha.
  • Resultat. Den färdiga filen är en 24 kHz WAV, redo att falla in i din redigeringstidslinje.

Vem är det för

Neural text till tal täcker många vardagliga jobb: att uttrycka ett klipp för sociala medier, göra en ljudversion av en artikel, berätta en presentation, kontrollera hur ett manus låter eller helt enkelt lyssna på ett dokument istället för att läsa det. Om du behöver en specifik persons röst, klona den från en kort inspelning.

Samma avsnitt har andra gratisverktyg som körs direkt i webbläsaren: djupkarta, borttagning av videobakgrund och video- och bilduppskalare.

Vanliga frågor

Är det verkligen gratis? Ja. Inga tokens debiteras för den här modellen och den har inget betald API - din dator gör jobbet.

Är min text uppladdad? Nej. Varken texten eller ljudet lämnar din enhet; endast verktygets kod och modellvikterna kommer från servern.

Hur lång tid tar det? En kort fras tar vanligtvis under en minut efter att modellen har laddats ner en gång; längre text tar längre tid och förloppsindikatorn visar var den är.