Коротко о главном (BLUF): Озвучка превращает текст в речь прямо в вашем браузере: введите текст, выберите язык и голос — и получите готовый аудиофайл. Текст и аудио никуда не отправляются, всё считается на вашем устройстве, токены не списываются и платного API здесь нет. Модель знает больше 600 языков, русский поддерживается полностью, а голос можно не только выбрать из готовых, но и клонировать по своему аудио — загруженному файлу или записи с микрофона. Готовый результат слушается в плеере и скачивается файлом WAV.
Это синтез речи: на входе текст, на выходе звук. Инструмент пригодится, когда нужно озвучить ролик своим или выбранным голосом, собрать черновую дорожку для видео, проверить, как звучит текст на другом языке, или просто послушать длинную статью вместо чтения.
Управлять подачей можно текстом-инструкцией: спокойное чтение, шёпот, радость или грусть. Интонация задаётся вместе с текстом, а не отдельными ползунками, поэтому результат звучит естественнее.
В инструменте есть библиотека готовых голосов — мужских и женских, разных тембров. Выберите язык и подходящий голос, и можно озвучивать.
Если нужен свой голос, его можно клонировать по короткому образцу: загрузите аудиофайл или запишите 15–30 секунд с микрофона. Инструмент разберёт образец и добавит голос в ваш список — дальше он выбирается так же, как готовый. Созданные голоса хранятся в браузере и переживают перезагрузку страницы.
Текст и аудио не покидают ваш компьютер: ни строчки не уходит ни на наш сервер, ни на чужой. Модель загружается в браузер один раз (около 3 ГБ весов) и дальше берётся из кеша, а расчёт идёт на вашей видеокарте через WebGPU. Если видеокарта недоступна, движок честно переходит на процессор и предупреждает об этом — считать будет заметно дольше.
Токены за озвучку не списываются: это бесплатный инструмент, который работает на вашем железе, а не на нашем.
В поле ввода помещается до 20 000 знаков. Длинный текст инструмент сам режет на части по границам предложений и озвучивает их подряд, добавляя короткие паузы, — так темп речи остаётся ровным независимо от длины, а концовка не теряется. В прогресс-баре видно, какая часть сейчас читается.
Отменить работу можно на любом шаге: после отмены повторный запуск стартует сразу, без перезагрузки страницы.
Лучше всего инструмент работает в Chrome или Edge на компьютере: там доступен WebGPU. В браузерах без WebGPU озвучка пойдёт по пути процессора (WASM) — она тоже работает, но заметно медленнее, особенно на большой нагрузке.
Первый запуск дольше обычного: скачиваются веса и прогревается голос, чтобы первый же результат звучал чисто. Дальше запуски заметно быстрее.
Да. Модель и её веса загружаются в браузер, а расчёт идёт на вашем устройстве. Текст, запись с микрофона и готовое аудио никуда не отправляются — у инструмента вообще нет платного API.
Ничего. Токены не списываются: это бесплатный инструмент, который считает на вашем компьютере.
Да. В поле ввода помещается до 20 000 знаков, длинный текст озвучивается частями подряд, и хвост не теряется.
Загрузите аудиофайл с образцом голоса или запишите 15–30 секунд с микрофона. Инструмент разберёт образец, и голос появится в вашем списке — им можно озвучивать любой текст.
Значит, браузер не смог использовать видеокарту (WebGPU) и движок перешёл на процессор — это медленнее, но результат тот же. Можно обновить страницу и попробовать снова: видеокарта часто освобождается.
Больше 600 языков, включая русский. Язык можно выбрать вручную или оставить автоматическое определение.