Коротко о главном (BLUF): Инструмент превращает аудио или видео в текст и субтитры: он распознаёт речь моделью Whisper прямо в браузере, сам определяет язык записи или принимает выбранный вручную, расставляет метки времени и отдаёт результат в TXT, SRT, VTT и JSON. Для видео дополнительно собирается ролик с прожжёнными субтитрами. Файл никуда не загружается, токены не списываются, платного API здесь нет.
Инструмент берёт аудио или видео и превращает речь в текст. Загружаете файл — получаете расшифровку с метками времени, готовые субтитры и, если это видео, тот же ролик с субтитрами, вжигаемыми прямо в кадры.
Распознавание идёт моделью Whisper (открытая многоязычная модель Xenova/whisper-tiny) через Transformers.js: сначала на видеокарте через WebGPU, а если браузер её не отдаёт — на процессоре через WASM. Звуковая дорожка извлекается из файла локально, в памяти браузера.
Аудио: MP3, WAV, M4A, AAC, OGG, Opus, FLAC. Видео: MP4, WebM, MOV, M4V, MKV, AVI, OGV. Из видео инструмент сам достаёт звуковую дорожку — отдельно её вырезать не нужно.
Звук приводится к моно 16 кГц — ровно к тому виду, который ждёт Whisper. Длинная запись распознаётся кусками по 30 секунд с перекрытием 5 секунд, поэтому на стыках не теряются слова.
Файл не отправляется на сервер: и звук, и распознавание, и сборка субтитров происходят внутри вашего браузера. Платного API здесь нет, токены не списываются.
Веса модели скачиваются один раз с открытого каталога Hugging Face и дальше лежат в кеше браузера — при следующем заходе модель поднимается уже без загрузки. Серверного инференса, CUDA и «резервного GPU на нашей стороне» у инструмента нет вовсе.
Whisper распознаёт 99 языков. По умолчанию язык определяется автоматически: инструмент показывает, какой язык он услышал. Если запись короткая или смешанная, язык можно выбрать вручную из списка — тогда распознавание идёт точнее.
Текст можно скопировать одной кнопкой или скачать в четырёх форматах. TXT — просто расшифровка, с метками времени или без них. SRT и VTT — готовые субтитры для плееров, видеоредакторов и YouTube. JSON — расшифровка с языком, длительностью и всеми репликами с метками времени, удобно для дальнейшей обработки.
Для видеофайла инструмент собирает новый ролик, в котором субтитры вжигаются прямо в кадры. Такое видео играет где угодно, даже там, где внешние субтитры не поддерживаются: в мессенджерах, соцсетях и на любом плеере. Звук исходника сохраняется.
Отдельно те же субтитры скачиваются файлами SRT и VTT — их можно подключить к исходному видео, не пересобирая его.
Он не переводит речь на другой язык: распознавание идёт на языке записи, перевод — отдельная задача. Он не разделяет говорящих по голосам и не расставляет имена спикеров.
Он не работает с музыкой и шумом как с речью: если в записи нет разборчивой речи, расшифровка будет пустой или неточной. Качество зависит от записи — на чистом голосе без шума и эха результат заметно лучше.
Выберите аудио или видео, при необходимости укажите язык (или оставьте автоопределение) и нажмите «Распознать речь». Дождитесь расшифровки — прогресс виден на экране, распознавание можно отменить.
Дальше скопируйте текст или скачайте TXT, SRT, VTT, JSON. Если загружали видео, нажмите «Сделать видео с субтитрами» и скачайте готовый ролик.
Авторам видео и подкастов — субтитры для публикации и расшифровка для описаний. Студентам и журналистам — текст лекций, интервью и диктофонных записей. Всем, кому нужно быстро получить текст из записи, не отправляя её на чужой сервер.
Никуда. Звук извлекается и распознаётся полностью внутри вашего браузера на вашем устройстве. На наш сервер файл не уходит.
Нет. Это бесплатный инструмент, который работает на вашем устройстве: платного API здесь нет, поэтому и списывать нечего.
Модель считает на вашем устройстве. Первый запуск дольше: скачиваются веса модели и прогревается граф. Дальше модель берётся из кеша браузера, и распознавание идёт быстрее.
Выберите язык вручную в списке и запустите распознавание снова — на коротких записях ручной выбор точнее автоопределения.
Да. Скачайте SRT или VTT и подключите их к видео, либо соберите ролик с прожжёнными субтитрами прямо в инструменте.