← Todos los artículos

Audio/vídeo → texto y subtítulos gratis: transcripción en

Estudio luminoso: portátil con una ventana de transcripción abierta, junto a una onda de audio y líneas ordenadas de subtítulos, reflejos suaves y brillantes

Ahora puedes transcribir audio o vídeo a texto gratis directamente en tu navegador: en la sección "Video" apareció una herramienta “Audio/vídeo → texto + subtítulos (gratis)”. Reconoce el habla, la muestra en texto con marcas de tiempo y proporciona subtítulos ya preparados, y no cancela tokens.

Sección de vídeo: la herramienta Audio/Vídeo a Texto + Subtítulos (gratuita) con un vídeo cargado, el texto reconocido con marcas de tiempo y los botones de descarga de subtítulos

¿Por qué es gratis?

Por lo general, el descifrado se realiza en el servidor de un servicio pago: se descarga el archivo, se cuentan los minutos y se paga por cada minuto. Aquí el modelo de reconocimiento de voz se carga en el navegador y se ejecuta en su computadora. El servidor solo proporciona el código de la herramienta y el peso del modelo: no tiene nada que contar, por lo que los tokens no se cancelan y el número de descifrados no está limitado.

De ahí la privacidad: la grabación no sale de tu ordenador. Esto es importante si estás transcribiendo entrevistas, llamadas de trabajo, conferencias o notas personales.

Cómo transcribir audio o vídeo: paso a paso

  1. Abierto Sección "Vídeo" y seleccione de la lista de modelos “Audio/vídeo → texto + subtítulos (gratis)” — la herramienta está ubicada en la parte inferior, junto a otras herramientas gratuitas.
  2. Cargue un archivo: haga clic en el campo de selección o arrastre y suelte audio o video directamente en él.
  3. Seleccione su idioma de voz o déjelo en "Detectar automáticamente". De forma predeterminada, el idioma de la interfaz del sitio está configurado, pero siempre puedes cambiarlo manualmente.
  4. Haga clic en "Reconocer voz" y espere hasta que esté listo. El primer inicio lleva más tiempo: el navegador descarga el modelo una vez y lo guarda en el caché.
  5. Verifique el texto, desactive las marcas de tiempo si es necesario y copie el resultado.
  6. Descargue subtítulos en el formato deseado: TXT, SRT, VTT o JSON. Para un video, puede ensamblar inmediatamente un video con subtítulos grabados.

¿Qué archivos son adecuados?

Audio: MP3, WAV, M4A, AAC, OGG, OPUS, FLAC y otros formatos comunes. Vídeos: MP4, MOV, M4V, MKV, AVI, OGV, WebM. El sonido del vídeo se extrae directamente en el navegador; no es necesario convertir el archivo por separado.

¿Qué obtendrás?

  • Texto de voz — transcripción con marcas de tiempo, que se pueden desactivar y obtener texto claro.
  • Copiar — todo el texto reconocido con un botón en el portapapeles.
  • TXT — texto simple para notas y documentos.
  • SRT — subtítulos para la mayoría de los reproductores y editores de vídeo.
  • VTT — subtítulos para reproductores web y HTML.
  • JSON - Piezas marcadas con tiempos para sus guiones.

Vídeo con subtítulos quemados.

Si carga un vídeo, la herramienta puede grabar subtítulos directamente en los fotogramas: dicho vídeo se reproduce en cualquier lugar, incluso donde no se admiten subtítulos. Se conserva el sonido de la fuente. La grabación se realiza en su dispositivo, el archivo no se envía a ninguna parte.

Todo cuenta en tu dispositivo

La voz reconoce el modelo Whisper al Transformers.js: primero prueba el WebGPU (tarjeta de video), y si no hay adaptador, honestamente cambia al WASM y cuenta con el procesador. Aquí no se paga API, los tokens no se cancelan y la grabación no va al servidor. Los registros largos tardan más en procesarse: todo se calcula en su computadora.

Lo que la herramienta no hace

Honestamente sobre los límites: esto es reconocimiento de voz, no traducción. La herramienta no traduce texto a otro idioma ni realiza doblajes. La calidad depende de la grabación: con una voz clara, sin mucho ruido y sin música, el resultado es notablemente mejor. Los vídeos con subtítulos grabados requieren un navegador moderno; este paso requiere Chrome o Edge.

¿A quién le resultará útil?

La herramienta es útil para todos los que trabajan con grabaciones: periodistas y podcasters - transcripciones de entrevistas, estudiantes - apuntes de conferencias, editores - subtítulos de vídeos, así como aquellos que llevan actas de reuniones. Si necesitas algo más con cita previa, en el apartado "Video" Hay eliminación de fondo, exclusivo Y mapa de profundidad — También calculan directamente en el navegador.

Preguntas frecuentes

¿Es realmente gratis? Sí. Los tokens para esta herramienta no se cargan, no tiene un API pagado: su computadora lo calcula.

¿El archivo va al servidor? No. La grabación y el resultado permanecen en su dispositivo; Sólo el código de herramienta y los pesos del modelo provienen del servidor.

¿Cuántos idiomas se admiten? Whisper reconoce 99 idiomas. Puede seleccionar el idioma manualmente o confiar en la detección automática.

¿Es posible obtener subtítulos como un archivo? Sí. TXT, SRT, VTT y JSON se descargan mediante botones separados.

¿La herramienta traduce el habla? No. Reconoce la voz en el idioma seleccionado, pero no la traduce a otro.

¿Por qué el primer lanzamiento tarda más? El navegador descarga el modelo de reconocimiento una vez y lo guarda en el caché; los siguientes lanzamientos comienzan inmediatamente.