Audio/video → testo e sottotitoli gratuiti: trascrizione
Ora puoi trascrivere audio o video in testo gratuitamente direttamente nel tuo browser: nella sezione "Video" è apparso uno strumento “Audio/video → testo + sottotitoli (gratuito)”. Riconosce il parlato, lo visualizza nel testo con timestamp e fornisce sottotitoli già pronti e non cancella i token.

Perché è gratuito
Di solito la decrittazione viene eseguita sul server di un servizio a pagamento: il file viene scaricato, vengono conteggiati i minuti e si paga per ogni minuto. Qui il modello di riconoscimento vocale viene caricato nel browser e viene eseguito sul tuo computer. Il server fornisce solo il codice dello strumento e il peso del modello: non ha nulla da contare, quindi i token non vengono cancellati e il numero di decrittazioni non è limitato.
Da qui la privacy: la registrazione non lascia il tuo computer. Questo è importante se stai trascrivendo interviste, chiamate di lavoro, conferenze o appunti personali.
Come trascrivere audio o video: passo dopo passo
- Aprire Sezione "Video". e seleziona dall'elenco dei modelli “Audio/video → testo + sottotitoli (gratuito)” — lo strumento si trova in basso, accanto ad altri strumenti gratuiti.
- Carica un file: clicca sul campo di selezione o trascina e rilascia l'audio o il video direttamente al suo interno.
- Seleziona la tua lingua vocale o lasciala su "Rileva automaticamente". Per impostazione predefinita, è impostata la lingua dell'interfaccia del sito, ma puoi sempre modificarla manualmente.
- Fai clic su "Riconosci discorso" e attendi finché non è pronto. Il primo avvio richiede più tempo: il browser scarica il modello una volta e lo salva nella cache.
- Controlla il testo, disabilita i timestamp se necessario e copia il risultato.
- Scarica i sottotitoli nel formato desiderato: TXT, SRT, VTT o JSON. Per un video, puoi immediatamente assemblare un video con i sottotitoli incorporati.
Quali file sono adatti?
Audio: MP3, WAV, M4A, AAC, OGG, OPUS, FLAC e altri formati comuni. Video: MP4, MOV, M4V, MKV, AVI, OGV, WebM. L'audio del video viene estratto direttamente nel browser; non è necessario convertire il file separatamente.
Cosa otterrai?
- Testo vocale — trascrizione con timestamp, che può essere disabilitata e ottenere testo chiaro.
- Copia - tutto il testo riconosciuto con un pulsante negli appunti.
- TXT — testo semplice per appunti e documenti.
- SRT — sottotitoli per la maggior parte dei lettori e degli editor video.
- VTT — sottotitoli per lettori web e HTML.
- JSON - hanno contrassegnato i pezzi con i tempi per i loro script.
Video con sottotitoli masterizzati
Se carichi un video, lo strumento può masterizzare i sottotitoli direttamente nei fotogrammi: tale video viene riprodotto ovunque, anche dove i sottotitoli non sono supportati. Il suono della sorgente viene mantenuto. La masterizzazione avviene sul tuo dispositivo, il file non viene inviato da nessuna parte.
Tutto conta sul tuo dispositivo
Il riconoscimento vocale riconosce il modello da Whisper a Transformers.js: prima prova WebGPU (scheda video), e se non c'è adattatore, passa onestamente a WASM e conta sul processore. Non viene pagato API qui, i token non vengono cancellati e la registrazione non va al server. I record lunghi richiedono più tempo per l'elaborazione: tutto viene calcolato sul tuo computer.
Cosa non fa lo strumento
Onestamente riguardo ai confini: questo è riconoscimento vocale, non traduzione. Lo strumento non traduce il testo in un'altra lingua né esegue il doppiaggio. La qualità dipende dalla registrazione: con un parlato chiaro senza troppo rumore e musica il risultato è notevolmente migliore. I video con sottotitoli masterizzati richiedono un browser moderno: questo passaggio richiede Chrome o Edge.
Chi lo troverà utile?
Lo strumento è utile per tutti coloro che lavorano con le registrazioni: giornalisti e podcaster - trascrizioni di interviste, studenti - dispense, redattori - sottotitoli per video, nonché coloro che tengono verbali delle riunioni. Se hai bisogno di altro previo appuntamento, nella sezione "Video" C'è rimozione dello sfondo, esclusivo E mappa di profondità — calcolano anche direttamente nel browser.
Domande frequenti
È davvero gratuito? SÌ. I gettoni per questo strumento non vengono addebitati, non ha un API pagato: lo calcola il tuo computer.
Il file va al server? No. La registrazione e il risultato rimangono sul tuo dispositivo; Solo il codice dell'utensile e i pesi del modello provengono dal server.
Quante lingue sono supportate? Whisper riconosce 99 lingue. È possibile selezionare la lingua manualmente o fidarsi del rilevamento automatico.
È possibile ottenere i sottotitoli come file? SÌ. TXT, SRT, VTT e JSON vengono scaricati utilizzando pulsanti separati.
Lo strumento traduce il parlato? No. Riconosce il parlato nella lingua selezionata, ma non lo traduce in un'altra.
Perché il primo lancio richiede più tempo? Il browser scarica il modello di riconoscimento una volta e lo salva nella cache: i lanci successivi iniziano immediatamente.