← Alle artikler

AI tekst til tale gratis: Uttal teksten din med et nevralt nettverk i nettleseren din

Lyst studio: en mikrofon og levende lydbølger – nevral tekst til tale rett i nettleseren

Du kan nå stemme teksten din med et nevralt nettverk gratis, uten noe å installere: Tekst til tale (gratis) modellen har ankommet Video del. Den kjører rett i nettleseren din - skriv inn teksten, velg et språk og en stemme, og noen sekunder senere lytter du til og laster ned den ferdige lydfilen. Verken teksten eller stemmeopptaket lastes opp noe sted: alt beregnes på din egen enhet.

Videoseksjon: Tekst til tale-modellen (gratis) valgt nederst på listen, med tekst-, språk- og stemmefelt

Hvorfor det er gratis

Vanlige taletjenester syntetiserer lyd på sine egne servere og tar penger eller tokens for det. Her lastes modellen inn i nettleseren og bruker datamaskinens grafikkort (WebGPU, med prosessoren som reserve). Serveren serverer bare verktøyets kode og modellvektene – den har ingenting å beregne, så ingen tokens belastes og antallet generasjoner er ubegrenset.

Personvern kommer også gratis: teksten du stemmer og stemmeopptaket ditt forblir på enheten din. Det betyr noe når du skal tale meldinger, dokumenter eller personlige notater.

Hvordan stemme tekst med et nevralt nettverk: trinn for trinn

  1. Åpne Videoseksjon og plukke Tekst til tale (gratis) i modelllisten — den sitter helt nederst, ved siden av de andre gratisverktøyene.
  2. Lim inn teksten i «Tekst til stemme»-feltet – opptil 2000 tegn om gangen.
  3. Velg språk. Hvis du ikke er sikker, la "Oppdag automatisk".
  4. Velg en stemme: kvinnelig eller mannlig, høyere eller lavere, en hvisking - eller en av dine lagrede stemmer.
  5. Trykk "Generer tale" og vent til den er ferdig. Du kan spille av resultatet på siden og laste det ned som en WAV-fil.

600+ språk

Modellen er flerspråklig: den kan mer enn 600 språk. For blandet tekst kan du la automatisk språkgjenkjenning være på, eller velge språket du trenger - listen inkluderer engelsk, tysk, fransk, spansk, kinesisk, japansk, arabisk og dusinvis mer, praktisk når du stemme videoer for flere land.

Hvordan klone en stemme

Du kan klone en stemme på to måter – begge er gratis og begge beregnes på enheten din:

  • Last opp en lydfil. MP3, WAV, M4A, OGG eller WebM opptil 30 sekunder fungerer bra.
  • Ta opp fra mikrofonen din. 10–20 sekunder med ren tale uten musikk eller støy er nok.

Etter analysen gjør verktøyet opptaket til en stemmeprofil og lagrer det i nettleseren din. Fra da av velger du bare den stemmen fra listen og uttaler hvilken som helst tekst med din egen stemme uten å laste opp opptaket igjen. Profilene holdes lokalt og overlever en sideinnlasting.

Hva du bør vite før første løpetur

  • Nettleser. En nylig Chrome eller Edge på et skrivebord fungerer best. Uten WebGPU faller modellen tilbake til prosessoren og er merkbart tregere – verktøyet advarer deg ærlig om det.
  • Første løp. Nettleseren laster ned modellvektene én gang (ca. 3 GB) og cacher dem. Senere løp starter umiddelbart.
  • Hukommelse. Omtrent 3 GB ledig minne er nødvendig. På en svak enhet viser verktøyet en klar advarsel i stedet for å krasje.
  • Resultat. Den ferdige filen er en 24 kHz WAV, klar til å slippe inn på redigeringstidslinjen din.

Hvem er det for

Nevral tekst til tale dekker mange hverdagslige jobber: gi uttrykk for et klipp for sosiale medier, lage en lydversjon av en artikkel, fortelle en presentasjon, sjekke hvordan et skript høres ut, eller bare lytte til et dokument i stedet for å lese det. Hvis du trenger en bestemt persons stemme, kan du klone den fra et kort opptak.

Den samme delen har andre gratisverktøy som kjører rett i nettleseren: dybdekart, fjerner videobakgrunn og video- og bildeoppskalering.

Ofte stilte spørsmål

Er det virkelig gratis? Ja. Ingen tokens belastes for denne modellen, og den har ingen betalt API - datamaskinen din gjør jobben.

Er teksten min lastet opp? Nei. Verken teksten eller lyden forlater enheten; bare verktøyets kode og modellvektene kommer fra serveren.

Hvor lang tid tar det? En kort setning tar vanligvis under et minutt etter at modellen har blitt lastet ned én gang; lengre tekst tar lengre tid, og fremdriftslinjen viser hvor den er.