OmniHuman 1.5 — нейросеть, создающая видео говорящего человека из одного фото и звуковой дорожки. Её отличие от классической липсинк-анимации в том, как персонаж проживает речь: модель слушает интонацию и ритм записи и подбирает под них мимику, взгляд и движения, поэтому герой не просто открывает рот в такт, а действительно будто разговаривает с вами.

Большинство аватар-моделей решают задачу механически: есть звук — есть движение губ. OmniHuman 1.5 идёт дальше и работает с характером речи. Восклицание поднимает брови, вопрос меняет взгляд, пауза даёт герою перевести дыхание. За счёт этого ролики меньше похожи на «озвученную маску» и больше — на запись живого выступления.
На практике это заметно на эмоциональном материале. Спокойный дикторский текст любая аватар-модель отработает пристойно, а вот воодушевлённая реплика, поздравление с придыханием или строчка из песни — та территория, где эта модель раскрывается. Если запись голоса несёт эмоцию, персонаж её подхватит и отыграет лицом.
Исходники стандартные: портрет в JPEG, PNG или WebP и звуковая дорожка в MP3, WAV, AAC, OGG или M4A. Оба файла — не больше 10 МБ. Запись обязана быть короче 15 секунд; если ваша длиннее — воспользуйтесь обрезкой прямо в форме генерации, она позволяет выделить нужный кусок за пару секунд.
Портрет выбирайте с хорошо различимым лицом и свободным ртом. При этом снимок не обязан быть студийным: модель уверенно оживляет и повседневные фото, и стилизованные изображения. Готовое видео сохраняется в истории генераций — скачивайте, сравнивайте дубли, пробуйте ту же дорожку с другим портретом.

Главный рычаг здесь — не фото, а звук. Запишите реплику так, как произнесли бы её на камеру: с паузами, ударениями, настоящей эмоцией. Монотонное чтение даст монотонного персонажа — модель честно отражает то, что слышит. Иногда полезно сделать два-три варианта начитки и сгенерировать все: разница в подаче удивляет.
С фотографией работает другое правило: оставляйте персонажу «воздух». Если лицо обрезано впритык, движениям головы негде развернуться. Кадр по грудь с запасом пространства вокруг головы даёт модели свободу для естественных наклонов и поворотов, которые и создают ощущение живого человека в кадре.
Есть сценарии, где нужна не информация, а харизма. Промо-ролик, где персонаж с азартом зовёт на распродажу. Исторический портрет, который «сам» рассказывает о себе на экскурсии или в школьном проекте. Обложка трека, где исполнитель на рисованной иллюстрации пропевает первые строчки. Во всех этих случаях решает именно эмоциональная анимация.
Отдельно стоит назвать коротенькие вертикальные ролики: там у автора есть секунды, чтобы зацепить зрителя, и выразительное лицо в кадре справляется с этим лучше любого текста на экране. Пятнадцатисекундный лимит дорожки идеально совпадает с этим форматом — реплика-крючок как раз столько и длится.
На сайте есть и Kling AI Avatar — соседняя модель того же назначения с выбором качества Standard и Pro. Логика выбора такая: нужен строгий, ровный корпоративный диктор в максимальном разрешении — пробуйте её. Нужна живость, эмоция и характер — начинайте с OmniHuman 1.5. А поскольку исходники у обеих одинаковые, ничто не мешает прогнать файлы через обе и оставить лучший дубль.
Если же задача не «оживить фото», а переозвучить готовый ролик, смотрите в сторону Volcengine Lip Sync: он меняет губы в существующем видео под новую дорожку. Для полноценных сцен с движением по сценарию есть видеомодели вроде Kling 3.0 — говорящие аватары заточены именно под крупный план и речь.
Да, модель оживляет не только фотографии: иллюстрации и стилизованные изображения с различимым лицом тоже работают. Важно, чтобы у персонажа были ясно читаемые глаза и рот — именно по ним строится мимика и артикуляция.
Почти наверняка дело в записи: модель повторяет энергетику голоса. Перезапишите реплику выразительнее — с интонацией, паузами, эмоцией — и персонаж оживёт. Плоское монотонное чтение даёт такую же плоскую мимику.
Одна генерация ограничена дорожкой короче 15 секунд. Длинную речь разбейте на несколько фрагментов, сгенерируйте их с одним и тем же портретом и склейте в любом видеоредакторе — стыки на статичном фоне почти незаметны.