Áudio/vídeo → texto e legendas grátis: transcrição no
Agora você pode transcrever áudio ou vídeo em texto gratuitamente diretamente no seu navegador: na seção "Vídeo" uma ferramenta apareceu “Áudio/vídeo → texto + legendas (grátis)”. Ele reconhece a fala, exibe-a em texto com carimbos de data e hora e fornece legendas prontas - e não descarta tokens.

Por que é grátis
Normalmente a descriptografia é feita no servidor de um serviço pago: o arquivo é baixado, os minutos são contados e eles pagam por cada minuto. Aqui o modelo de reconhecimento de fala é carregado no navegador e executado no seu computador. O servidor fornece apenas o código da ferramenta e o peso do modelo: não tem nada para contar, portanto os tokens não são baixados e o número de descriptografias não é limitado.
Daí a privacidade: a gravação não sai do seu computador. Isso é importante se você estiver transcrevendo entrevistas, ligações de trabalho, palestras ou anotações pessoais.
Como transcrever áudio ou vídeo: passo a passo
- Abrir Seção "Vídeo" e selecione na lista de modelos “Áudio/vídeo → texto + legendas (grátis)” — a ferramenta está localizada na parte inferior, ao lado de outras ferramentas gratuitas.
- Carregar um arquivo: clique no campo de seleção ou arraste e solte áudio ou vídeo diretamente nele.
- Selecione seu idioma de fala – ou deixe-o em “Detectar automaticamente”. Por padrão, o idioma da interface do site está definido, mas você sempre pode alterá-lo manualmente.
- Clique em “Reconhecer fala” e espere até que esteja pronto. A primeira inicialização demora mais: o navegador baixa o modelo uma vez e o salva no cache.
- Verifique o texto, desative os carimbos de data/hora se necessário e copie o resultado.
- Baixe as legendas no formato desejado - TXT, SRT, VTT ou JSON. Para um vídeo, você pode montar imediatamente um vídeo com legendas gravadas.
Quais arquivos são adequados?
Áudio: MP3, WAV, M4A, AAC, OGG, OPUS, FLAC e outros formatos comuns. Vídeos: MP4, MOV, M4V, MKV, AVI, OGV, WebM. O som do vídeo é extraído diretamente no navegador; não há necessidade de converter o arquivo separadamente.
O que você vai conseguir
- Texto de fala — transcrição com carimbos de data/hora, que pode ser desabilitada e obter texto não criptografado.
- Cópia — todo o texto reconhecido com um botão para a área de transferência.
- TXT — texto simples para notas e documentos.
- SRT — legendas para a maioria dos reprodutores e editores de vídeo.
- VTT — legendas para players web e HTML.
- JSON — peças marcadas com tempos para seus roteiros.
Vídeo com legendas queimadas
Se você enviar um vídeo, a ferramenta pode gravar legendas diretamente nos quadros: esse tipo de vídeo é reproduzido em qualquer lugar, mesmo onde as legendas não são suportadas. O som da fonte é retido. A gravação ocorre no seu dispositivo, o arquivo não é enviado para lugar nenhum.
Tudo conta no seu dispositivo
A fala reconhece o modelo Whisper a Transformers.js: primeiro tenta WebGPU (placa de vídeo), e se não houver adaptador, honestamente muda para WASM e conta com o processador. Não há API pago aqui, os tokens não são debitados e a gravação não vai para o servidor. Registros longos demoram mais para serem processados - tudo é calculado no seu computador.
O que a ferramenta não faz
Honestamente sobre os limites: isso é reconhecimento de fala, não tradução. A ferramenta não traduz texto para outro idioma nem faz dublagem. A qualidade depende da gravação: com fala clara, sem muito ruído e música, o resultado é visivelmente melhor. Vídeos com legendas gravadas requerem um navegador moderno - esta etapa requer Chrome ou Edge.
Quem achará isso útil?
A ferramenta é útil para todos que trabalham com gravações: jornalistas e podcasters - transcrições de entrevistas, estudantes - notas de aula, editores - legendas de vídeos, além de quem mantém atas de reuniões. Se precisar de mais alguma coisa com hora marcada, na seção "Vídeo" Há remoção de fundo, sofisticado E mapa de profundidade — eles também calculam diretamente no navegador.
Perguntas frequentes
É realmente grátis? Sim. Os tokens desta ferramenta não são debitados, ela não possui API pago - seu computador calcula.
O arquivo vai para o servidor? Não. A gravação e o resultado permanecem no seu dispositivo; Somente o código da ferramenta e os pesos do modelo vêm do servidor.
Quantos idiomas são suportados? Whisper reconhece 99 idiomas. Você pode selecionar o idioma manualmente ou confiar na detecção automática.
É possível obter legendas como um arquivo? Sim. TXT, SRT, VTT e JSON são baixados usando botões separados.
A ferramenta traduz a fala? Não. Ele reconhece a fala no idioma selecionado, mas não a traduz para outro.
Por que o primeiro lançamento demora mais? O navegador baixa o modelo de reconhecimento uma vez e o salva no cache – as próximas inicializações começam imediatamente.