OmniHuman 1.5 — оживление портрета с речью, эмоциями и жестами

OmniHuman 1.5 — нейросеть, создающая видео говорящего человека из одного фото и звуковой дорожки. Её отличие от классической липсинк-анимации в том, как персонаж проживает речь: модель слушает интонацию и ритм записи и подбирает под них мимику, взгляд и движения, поэтому герой не просто открывает рот в такт, а действительно будто разговаривает с вами.

Молодая преподавательница говорит в камеру в уютной комнате с книжными полками

Чем эта модель отличается от других говорящих аватаров

Большинство аватар-моделей решают задачу механически: есть звук — есть движение губ. OmniHuman 1.5 идёт дальше и работает с характером речи. Восклицание поднимает брови, вопрос меняет взгляд, пауза даёт герою перевести дыхание. За счёт этого ролики меньше похожи на «озвученную маску» и больше — на запись живого выступления.

На практике это заметно на эмоциональном материале. Спокойный дикторский текст любая аватар-модель отработает пристойно, а вот воодушевлённая реплика, поздравление с придыханием или строчка из песни — та территория, где эта модель раскрывается. Если запись голоса несёт эмоцию, персонаж её подхватит и отыграет лицом.

Что загрузить и какие есть ограничения

Исходники стандартные: портрет в JPEG, PNG или WebP и звуковая дорожка в MP3, WAV, AAC, OGG или M4A. Оба файла — не больше 10 МБ. Запись обязана быть короче 15 секунд; если ваша длиннее — воспользуйтесь обрезкой прямо в форме генерации, она позволяет выделить нужный кусок за пару секунд.

Портрет выбирайте с хорошо различимым лицом и свободным ртом. При этом снимок не обязан быть студийным: модель уверенно оживляет и повседневные фото, и стилизованные изображения. Готовое видео сохраняется в истории генераций — скачивайте, сравнивайте дубли, пробуйте ту же дорожку с другим портретом.

Мужчина средних лет в костюме выступает на камеру в современном холле

Как выжать из модели максимум выразительности

Главный рычаг здесь — не фото, а звук. Запишите реплику так, как произнесли бы её на камеру: с паузами, ударениями, настоящей эмоцией. Монотонное чтение даст монотонного персонажа — модель честно отражает то, что слышит. Иногда полезно сделать два-три варианта начитки и сгенерировать все: разница в подаче удивляет.

С фотографией работает другое правило: оставляйте персонажу «воздух». Если лицо обрезано впритык, движениям головы негде развернуться. Кадр по грудь с запасом пространства вокруг головы даёт модели свободу для естественных наклонов и поворотов, которые и создают ощущение живого человека в кадре.

Где такой аватар полезнее всего

Есть сценарии, где нужна не информация, а харизма. Промо-ролик, где персонаж с азартом зовёт на распродажу. Исторический портрет, который «сам» рассказывает о себе на экскурсии или в школьном проекте. Обложка трека, где исполнитель на рисованной иллюстрации пропевает первые строчки. Во всех этих случаях решает именно эмоциональная анимация.

Отдельно стоит назвать коротенькие вертикальные ролики: там у автора есть секунды, чтобы зацепить зрителя, и выразительное лицо в кадре справляется с этим лучше любого текста на экране. Пятнадцатисекундный лимит дорожки идеально совпадает с этим форматом — реплика-крючок как раз столько и длится.

Сравнить и выбрать: когда взять другую модель

На сайте есть и Kling AI Avatar — соседняя модель того же назначения с выбором качества Standard и Pro. Логика выбора такая: нужен строгий, ровный корпоративный диктор в максимальном разрешении — пробуйте её. Нужна живость, эмоция и характер — начинайте с OmniHuman 1.5. А поскольку исходники у обеих одинаковые, ничто не мешает прогнать файлы через обе и оставить лучший дубль.

Если же задача не «оживить фото», а переозвучить готовый ролик, смотрите в сторону Volcengine Lip Sync: он меняет губы в существующем видео под новую дорожку. Для полноценных сцен с движением по сценарию есть видеомодели вроде Kling 3.0 — говорящие аватары заточены именно под крупный план и речь.

Частые вопросы

Подойдёт ли рисованный или стилизованный портрет?

Да, модель оживляет не только фотографии: иллюстрации и стилизованные изображения с различимым лицом тоже работают. Важно, чтобы у персонажа были ясно читаемые глаза и рот — именно по ним строится мимика и артикуляция.

Почему мой аватар получился вялым и неживым?

Почти наверняка дело в записи: модель повторяет энергетику голоса. Перезапишите реплику выразительнее — с интонацией, паузами, эмоцией — и персонаж оживёт. Плоское монотонное чтение даёт такую же плоскую мимику.

Можно ли сделать ролик длиннее 15 секунд?

Одна генерация ограничена дорожкой короче 15 секунд. Длинную речь разбейте на несколько фрагментов, сгенерируйте их с одним и тем же портретом и склейте в любом видеоредакторе — стыки на статичном фоне почти незаметны.

Похожие модели