Kling AI Avatar — нейросеть, которая делает из фотографии говорящего человека. Загружаете портрет и аудиофайл с речью — и получаете видео, где человек с фото произносит эти слова: губы движутся синхронно со звуком, лицо живёт, голова естественно покачивается. Камера, свет и дикция диктора не нужны — достаточно одного снимка и записи голоса.

Нужны ровно два файла. Первый — изображение лица: подойдут JPEG, PNG или WebP размером до 10 МБ. Второй — аудио с речью: MP3, WAV, AAC, OGG или M4A, тоже до 10 МБ. Жёсткое ограничение одно: дорожка должна длиться строго меньше 15 секунд. Если запись длиннее, прямо в форме есть инструмент обрезки — выделяете нужный фрагмент и не пересохраняете файл во внешних программах.
Дальше всё делает модель: распознаёт лицо, придумывает артикуляцию под каждый звук, добавляет микродвижения — моргание, повороты головы, живую мимику. Результат приходит в историю генераций, откуда его можно скачать или повторить с другим звуком. Один и тот же портрет можно озвучивать сколько угодно раз разными репликами.
У модели два режима качества. Standard выдаёт видео в 720p — этого достаточно для сторис, мессенджеров и любых вертикальных форматов, где ролик смотрят с телефона. Pro генерирует в 1080p: детализация лица выше, картинка чище, и такой аватар не стыдно вставить в презентацию или на экран стенда.
Практичный порядок работы: сначала прогоните связку «фото плюс звук» в Standard и проверьте, как легла артикуляция и не появилось ли искажений. Если дубль удачный — перегенерируйте его в Pro для финальной версии. Стоимость зависит от длительности и выбранного качества, так что черновики в высоком разрешении — пустая трата баланса.

Лучший исходник — портрет анфас или почти анфас, с открытым лицом, без солнечных очков и предметов, перекрывающих рот. Рот — главная рабочая зона модели: если он скрыт рукой, микрофоном или чашкой, синхронизация губ не получится. Освещение ровное, лицо занимает заметную часть кадра, фон — любой.
К звуку требования мягче, но логика та же: чем чище речь, тем точнее артикуляция. Запись без фоновой музыки и шума улицы, с нормальной громкостью, даст лучший результат, чем голосовое сообщение, записанное на бегу. Пятнадцатисекундный лимит подталкивает к ёмким фразам — и это к лучшему: короткие реплики в роликах работают сильнее длинных монологов.
Самый душевный сценарий — персональные поздравления. Фото друга плюс начитанное поздравление — и он получает видео, где сам «произносит» тост на собственном юбилее. Для бизнеса рабочая связка другая: лицо основателя или вымышленного персонажа-консультанта коротко представляет товар в карточке, приветствует посетителей сайта или анонсирует акцию в сторис.
Преподаватели и авторы курсов озвучивают короткие вставки-объяснения, не записывая себя на камеру каждый раз: одно удачное фото работает вместо студии. А SMM-специалисты держат «цифрового ведущего» — постоянного персонажа, который от ролика к ролику комментирует новости бренда одним и тем же узнаваемым лицом.
Чаще всего виноват исходник. Лицо в полупрофиль, наклонённая голова, мелкий портрет в полный рост — во всех этих случаях модели не хватает данных о рте и мимике, и артикуляция выходит смазанной. Решение простое: кадрируйте фото ближе к лицу и выбирайте снимок с прямым взглядом.
Вторая причина — перегруженное аудио. Если под речью играет музыка или говорят двое, модель не понимает, под что синхронизировать губы. И проверьте длительность: дорожка на 15 секунд и больше не пройдёт валидацию — обрежьте её встроенным инструментом до 14 секунд с запасом, оставив только суть реплики.
Подходят MP3, WAV, AAC, OGG и M4A до 10 МБ, длительность — строго меньше 15 секунд. Длинную запись не нужно резать во внешних редакторах: в форме генерации есть обрезка, где вы выделяете нужный фрагмент прямо перед запуском.
В разрешении готового видео: Standard даёт 720p, Pro — 1080p с более детальной картинкой. Механика анимации одинаковая, поэтому пробы удобно делать в Standard, а финальную версию для публикации генерировать в Pro.
Только с его согласия. Озвучивать чужие лица без разрешения недопустимо: это нарушает права человека на изображение. Безопасные варианты — ваши собственные фото, снимки согласившихся близких или сгенерированные нейросетью персонажи.