Аудио/видео → текст + субтитры (бесплатно) — распознавание речи в браузере

Коротко о главном (BLUF): Инструмент превращает аудио или видео в текст и субтитры: он распознаёт речь моделью Whisper прямо в браузере, сам определяет язык записи или принимает выбранный вручную, расставляет метки времени и отдаёт результат в TXT, SRT, VTT и JSON. Для видео дополнительно собирается ролик с прожжёнными субтитрами. Файл никуда не загружается, токены не списываются, платного API здесь нет.

Что делает инструмент

Инструмент берёт аудио или видео и превращает речь в текст. Загружаете файл — получаете расшифровку с метками времени, готовые субтитры и, если это видео, тот же ролик с субтитрами, вжигаемыми прямо в кадры.

Распознавание идёт моделью Whisper (открытая многоязычная модель Xenova/whisper-tiny) через Transformers.js: сначала на видеокарте через WebGPU, а если браузер её не отдаёт — на процессоре через WASM. Звуковая дорожка извлекается из файла локально, в памяти браузера.

Какие файлы можно загрузить

Аудио: MP3, WAV, M4A, AAC, OGG, Opus, FLAC. Видео: MP4, WebM, MOV, M4V, MKV, AVI, OGV. Из видео инструмент сам достаёт звуковую дорожку — отдельно её вырезать не нужно.

Звук приводится к моно 16 кГц — ровно к тому виду, который ждёт Whisper. Длинная запись распознаётся кусками по 30 секунд с перекрытием 5 секунд, поэтому на стыках не теряются слова.

Всё считается на вашем устройстве

Файл не отправляется на сервер: и звук, и распознавание, и сборка субтитров происходят внутри вашего браузера. Платного API здесь нет, токены не списываются.

Веса модели скачиваются один раз с открытого каталога Hugging Face и дальше лежат в кеше браузера — при следующем заходе модель поднимается уже без загрузки. Серверного инференса, CUDA и «резервного GPU на нашей стороне» у инструмента нет вовсе.

Языки и автоопределение

Whisper распознаёт 99 языков. По умолчанию язык определяется автоматически: инструмент показывает, какой язык он услышал. Если запись короткая или смешанная, язык можно выбрать вручную из списка — тогда распознавание идёт точнее.

Экспорт: TXT, SRT, VTT и JSON

Текст можно скопировать одной кнопкой или скачать в четырёх форматах. TXT — просто расшифровка, с метками времени или без них. SRT и VTT — готовые субтитры для плееров, видеоредакторов и YouTube. JSON — расшифровка с языком, длительностью и всеми репликами с метками времени, удобно для дальнейшей обработки.

Видео с прожжёнными субтитрами

Для видеофайла инструмент собирает новый ролик, в котором субтитры вжигаются прямо в кадры. Такое видео играет где угодно, даже там, где внешние субтитры не поддерживаются: в мессенджерах, соцсетях и на любом плеере. Звук исходника сохраняется.

Отдельно те же субтитры скачиваются файлами SRT и VTT — их можно подключить к исходному видео, не пересобирая его.

Чего инструмент не делает

Он не переводит речь на другой язык: распознавание идёт на языке записи, перевод — отдельная задача. Он не разделяет говорящих по голосам и не расставляет имена спикеров.

Он не работает с музыкой и шумом как с речью: если в записи нет разборчивой речи, расшифровка будет пустой или неточной. Качество зависит от записи — на чистом голосе без шума и эха результат заметно лучше.

Как пользоваться

Выберите аудио или видео, при необходимости укажите язык (или оставьте автоопределение) и нажмите «Распознать речь». Дождитесь расшифровки — прогресс виден на экране, распознавание можно отменить.

Дальше скопируйте текст или скачайте TXT, SRT, VTT, JSON. Если загружали видео, нажмите «Сделать видео с субтитрами» и скачайте готовый ролик.

Кому пригодится

Авторам видео и подкастов — субтитры для публикации и расшифровка для описаний. Студентам и журналистам — текст лекций, интервью и диктофонных записей. Всем, кому нужно быстро получить текст из записи, не отправляя её на чужой сервер.

Частые вопросы

Куда отправляется мой файл?

Никуда. Звук извлекается и распознаётся полностью внутри вашего браузера на вашем устройстве. На наш сервер файл не уходит.

Списываются ли токены?

Нет. Это бесплатный инструмент, который работает на вашем устройстве: платного API здесь нет, поэтому и списывать нечего.

Почему распознавание идёт не мгновенно?

Модель считает на вашем устройстве. Первый запуск дольше: скачиваются веса модели и прогревается граф. Дальше модель берётся из кеша браузера, и распознавание идёт быстрее.

Что делать, если язык определился неверно?

Выберите язык вручную в списке и запустите распознавание снова — на коротких записях ручной выбор точнее автоопределения.

Можно ли получить субтитры для видео?

Да. Скачайте SRT или VTT и подключите их к видео, либо соберите ролик с прожжёнными субтитрами прямо в инструменте.

Похожие модели