Sintesi vocale AI gratuita: dai voce al tuo testo con una rete neurale nel tuo browser
Ora puoi esprimere il tuo testo con una rete neurale gratuitamente, senza nulla da installare: il Sintesi vocale (gratuita) il modello è arrivato in Video sezione. Funziona direttamente nel tuo browser: digita il testo, scegli una lingua e una voce e pochi secondi dopo ascolti e scarichi il file audio finito. Né il testo né la registrazione vocale vengono caricati da nessuna parte: tutto viene calcolato sul tuo dispositivo.

Perché è gratuito
I normali servizi vocali sintetizzano l'audio sui propri server e addebitano denaro o gettoni per questo. Qui il modello viene caricato nel browser e utilizza la scheda grafica del tuo computer (WebGPU, con il processore come fallback). Il server fornisce solo il codice dello strumento e i pesi del modello: non ha nulla da calcolare, quindi non vengono addebitati token e il numero di generazioni è illimitato.
Anche la privacy è gratuita: il testo che pronunci e la registrazione vocale rimangono sul tuo dispositivo. Ciò è importante quando si esprimono messaggi, documenti o note personali.
Come pronunciare il testo con una rete neurale: passo dopo passo
- Apri il Sezione video e scegli Sintesi vocale (gratuita) nell'elenco dei modelli: si trova in fondo, accanto agli altri strumenti gratuiti.
- Incolla il tuo testo nel campo "Testo in voce": fino a 2000 caratteri alla volta.
- Scegli la lingua. Se non sei sicuro, lascia "Rileva automaticamente".
- Scegli una voce: femminile o maschile, più alta o più bassa, un sussurro o una delle tue voci salvate.
- Premi "Genera discorso" e attendi che finisca. Puoi riprodurre il risultato sulla pagina e scaricarlo come file WAV.
600+ lingue
Il modello è multilingue: conosce più di 600 lingue. Per il testo misto puoi lasciare attivo il rilevamento automatico della lingua o scegliere la lingua che ti serve: l'elenco include inglese, tedesco, francese, spagnolo, cinese, giapponese, arabo e decine di altre, utili quando si esprimono video per diversi paesi.
Come clonare una voce
Puoi clonare una voce in due modi: entrambi sono gratuiti ed entrambi vengono calcolati sul tuo dispositivo:
- Carica un file audio. MP3, WAV, M4A, OGG o WebM fino a 30 secondi funziona bene.
- Registra dal tuo microfono. Sono sufficienti 10-20 secondi di discorso pulito senza musica o rumore.
Dopo l'analisi lo strumento trasforma la registrazione in un profilo vocale e lo memorizza nel tuo browser. Da quel momento in poi dovrai semplicemente selezionare quella voce dall'elenco e pronunciare qualsiasi testo con la tua voce senza caricare nuovamente la registrazione. I profili vengono mantenuti localmente e sopravvivono al ricaricamento della pagina.
Cosa sapere prima della prima corsa
- Navigatore. Un Chrome o Edge recente su un desktop funziona meglio. Senza WebGPU il modello ritorna al processore ed è notevolmente più lento: lo strumento ti avvisa onestamente.
- Prima corsa. Il browser scarica i pesi del modello una volta (circa 3 GB) e li memorizza nella cache. Le corse successive iniziano immediatamente.
- Memoria. Sono necessari circa 3 GB di memoria libera. Su un dispositivo debole lo strumento mostra un chiaro avviso invece di bloccarsi.
- Risultato. Il file finito è un 24 kHz WAV, pronto per essere inserito nella timeline di editing.
Per chi è
La sintesi vocale neurale copre numerosi lavori quotidiani: dare voce a una clip per i social media, realizzare una versione audio di un articolo, narrare una presentazione, controllare come suona uno script o semplicemente ascoltare un documento invece di leggerlo. Se hai bisogno della voce di una persona specifica, clonala da una breve registrazione.
La stessa sezione contiene altri strumenti gratuiti che funzionano direttamente nel browser: mappa di profondità, rimozione dello sfondo del video E upscaler di video e immagini.
Domande frequenti
È davvero gratuito? SÌ. Per questo modello non vengono addebitati token e non ha API a pagamento: il tuo computer fa il lavoro.
Il mio testo è stato caricato? No. Né il testo né l'audio lasciano il tuo dispositivo; solo il codice dell'utensile ed i pesi del modello provengono dal server.
Quanto tempo ci vuole? Una breve frase richiede solitamente meno di un minuto dopo che il modello è stato scaricato una volta; il testo più lungo richiede più tempo e la barra di avanzamento mostra dove si trova.