Коротко о главном (BLUF): Инструмент расшифровывает аудио и видео в текст целиком в браузере: файл не отправляется на наш сервер, токены не списываются, распознанный текст можно править.
Модель Whisper (около 40 МБ) скачивается один раз и кешируется браузером. Язык можно определить автоматически или выбрать вручную. Результат показывается с метками времени, его можно править, копировать и скачивать как TXT, SRT, VTT или JSON.
Если загружено видео, из него можно собрать ролик с прожжёнными субтитрами (в Chrome и Edge) и скачать готовый файл.
Распознавание идёт на вашем устройстве: ни сам файл, ни полученный текст не уходят на наш сервер. Платного API нет, токены не списываются.
Качество зависит от записи: на чёткой речи модель точна, на шумной записи возможны ошибки. Распознанный текст можно поправить перед сохранением субтитров.
Да, токены не списываются: модель работает локально в браузере.
Нет, ни аудио, ни видео, ни распознанный текст не покидают ваше устройство.
Да, текст правится прямо на странице, и правки попадают в субтитры.
TXT, SRT, VTT, JSON, а для видео — готовый ролик с прожжёнными субтитрами.