← Все статьи

Аудио/видео → текст и субтитры бесплатно: расшифровка

Светлая студия: ноутбук с открытым окном расшифровки, рядом аудиоволна и аккуратные строки субтитров, мягкие яркие блики

Расшифровать аудио или видео в текст теперь можно бесплатно прямо в браузере: в разделе «Видео» появился инструмент «Аудио/видео → текст + субтитры (бесплатно)». Он распознаёт речь, показывает её текстом с метками времени и отдаёт готовые субтитры — и не списывает токены.

Video section: the Audio/Video to Text + Subtitles (free) tool with a loaded video, the recognized text with timestamps and the subtitle download buttons

Почему это бесплатно

Обычно расшифровку делают на сервере платного сервиса: файл загружается, минуты считаются, за каждую минуту платят. Здесь модель распознавания речи подгружается в браузер и работает на вашем компьютере. Сервер отдаёт только код инструмента и веса модели: считать ему нечего, поэтому токены не списываются, а число расшифровок не ограничено.

Отсюда же и приватность: запись не покидает ваш компьютер. Это важно, если вы расшифровываете интервью, рабочие созвоны, лекции или личные заметки.

Как расшифровать аудио или видео: пошагово

  1. Откройте раздел «Видео» и выберите в списке моделей «Аудио/видео → текст + субтитры (бесплатно)» — инструмент стоит внизу, рядом с другими бесплатными инструментами.
  2. Загрузите файл: нажмите на поле выбора или перетащите аудио либо видео прямо в него.
  3. Выберите язык речи — или оставьте «Определить автоматически». По умолчанию подставляется язык интерфейса сайта, но его всегда можно поменять вручную.
  4. Нажмите «Распознать речь» и дождитесь готовности. Первый запуск дольше: браузер один раз скачивает модель и сохраняет её в кеш.
  5. Проверьте текст, при необходимости отключите метки времени и скопируйте результат.
  6. Скачайте субтитры в нужном формате — TXT, SRT, VTT или JSON. Для видео можно сразу собрать ролик с прожжёнными субтитрами.

Какие файлы подойдут

Аудио: MP3, WAV, M4A, AAC, OGG, OPUS, FLAC и другие распространённые форматы. Видео: MP4, MOV, M4V, MKV, AVI, OGV, WebM. Звук из видео извлекается прямо в браузере, отдельно конвертировать файл не нужно.

Что вы получите

  • Текст речи — расшифровка с метками времени, которые можно отключить и получить чистый текст.
  • Копирование — весь распознанный текст одной кнопкой в буфер обмена.
  • TXT — простой текст для заметок и документов.
  • SRT — субтитры для большинства плееров и видеоредакторов.
  • VTT — субтитры для веба и HTML-плееров.
  • JSON — размеченные куски с таймингами для своих скриптов.

Видео с прожжёнными субтитрами

Если загрузить видео, инструмент может вжечь субтитры прямо в кадры: такое видео играет где угодно, даже там, где субтитры не поддерживаются. Звук исходника при этом сохраняется. Вжигание идёт на вашем устройстве, файл никуда не отправляется.

Всё считается на вашем устройстве

Речь распознаёт модель Whisper через Transformers.js: сначала она пробует WebGPU (видеокарта), а если адаптера нет — честно переходит на WASM и считает на процессоре. Платного API здесь нет, токены не списываются, а запись не уходит на сервер. Длинные записи обрабатываются дольше — всё считается на вашем компьютере.

Чего инструмент не делает

Честно о границах: это распознавание речи, а не перевод. Инструмент не переводит текст на другой язык и не делает дубляж. Качество зависит от записи: на чистой речи без сильного шума и музыки результат заметно лучше. Видео с прожжёнными субтитрами требует современного браузера — для этого шага нужен Chrome или Edge.

Кому пригодится

Инструмент полезен всем, кто работает с записями: журналистам и подкастерам — расшифровка интервью, студентам — конспект лекции, монтажёрам — субтитры к ролику, а также тем, кто ведёт протоколы встреч. Если по записи нужно ещё что-то, в разделе «Видео» есть удаление фона, апскейл и карта глубины — они тоже считают прямо в браузере.

Частые вопросы

Это правда бесплатно? Да. Токены за этот инструмент не списываются, платного API у него нет — считает ваш компьютер.

Файл уходит на сервер? Нет. Запись и результат остаются на вашем устройстве; с сервера приходит только код инструмента и веса модели.

Сколько языков поддерживается? Whisper распознаёт 99 языков. Язык можно выбрать вручную или доверить автоопределению.

Можно ли получить субтитры файлом? Да. TXT, SRT, VTT и JSON скачиваются отдельными кнопками.

Инструмент переводит речь? Нет. Он распознаёт речь на выбранном языке, но не переводит её на другой.

Почему первый запуск дольше? Браузер один раз скачивает модель распознавания и сохраняет её в кеш — следующие запуски стартуют сразу.