Kling 3.0 Motion Control — нейросеть для переноса движения: вы даёте ей фотографию персонажа и видео-референс с нужным действием, а она генерирует ролик, где герой с фото повторяет движения из видео. Танец, походка, жестикуляция — всё копируется с эталона и накладывается на вашего персонажа. Это третье поколение технологии, самое точное на сегодня.

Представьте, что нужно заставить нарисованного маскота станцевать модный танец. Снимать мокап-студию ради этого никто не будет. Вместо этого вы находите ролик, где танец исполняет живой человек, загружаете его как референс, добавляете изображение маскота — и получаете готовую анимацию. Движение считывается с видео, внешность берётся с картинки.
Такой подход снимает главное ограничение обычной генерации по тексту: словами очень трудно описать хореографию или точную пластику. Здесь описывать ничего не надо — вы просто показываете. Что в референсе, то и в результате, только в исполнении вашего героя, будь то человек с фотографии, персонаж бренда или рисованный кот.
На сайте доступны оба поколения Motion Control, и разница между ними ощутимая. Версия 3.0 точнее удерживает личность персонажа при сложных движениях, лучше справляется с быстрыми сменами поз и даёт заметно меньше «поплывших» рук и лиц. Если вы делаете ролик, где важна чистота картинки, начинать стоит именно с неё.
Кроме того, у 3.0 появилась настройка, которой нет у предшественницы, — ориентация персонажа. Вы выбираете, откуда брать положение героя в кадре: из видео-референса или из вашего изображения. Это решает классическую проблему прошлого поколения, когда персонаж с портретной фотографии неуклюже вписывался в горизонтальную сцену из референса.

Режим «по видео» разворачивает героя так, как двигается человек в референсе, и позволяет генерировать ролики длиной до 30 секунд — этого хватает на полноценный танцевальный фрагмент или развёрнутую сценку. Режим «по изображению» сохраняет ракурс и положение с вашей картинки, но ограничен десятью секундами. Выбор зависит от того, что важнее: длина или верность исходному кадру.
Разрешение выбирается в форме: 720p для быстрых черновиков и проб, 1080p для финального результата, который пойдёт в публикацию. Разумная стратегия — отладить связку «фото плюс референс» на низком разрешении, а удачный вариант перегенерировать в высоком. Итог сохраняется в истории, откуда его можно скачать или продлить.
Идеальный референс — ролик, где один человек целиком в кадре, движения читаются ясно, камера статична или движется плавно. Резкий монтаж, мельтешение и перекрытие тела другими объектами ломают распознавание движения. Если хотите перенести танец из соцсетей, выбирайте дубль, где танцора видно с головы до ног от начала до конца.
С изображением персонажа правила похожие: герой должен быть виден целиком или хотя бы по пояс, в позе, из которой движение может естественно начаться. Персонаж, сидящий в кресле, вряд ли красиво подхватит прыжок из референса. Согласуйте стартовые позы — и переход в движение получится гладким.
Маркетологи анимируют талисманов брендов под вирусные танцы, не нанимая аниматоров. Художники оживляют своих персонажей, показывая им движения из собственных любительских съёмок: сняли себя на телефон — и рисованный герой повторил. Блогеры делают ролики, где их аватар выполняет трюки, которые в жизни повторять не хочется.
Отдельная ниша — контент с людьми, которых нельзя позвать на съёмку. Фотография сотрудника плюс референс с приветственным жестом — и готов ролик для корпоративной рассылки. Помните только, что использовать чужие лица без согласия недопустимо: работайте со своими фото, своими персонажами и материалами, на которые у вас есть права.
Обычная image-to-video модель придумывает движение сама или по текстовому описанию. Здесь движение не придумывается, а копируется с загруженного вами видео-референса. Это даёт точный контроль над хореографией, который текстом получить практически невозможно.
Зависит от выбранной ориентации персонажа: в режиме «по видео» — до 30 секунд, в режиме «по изображению» — до 10 секунд. В обоих случаях длительность результата привязана к загруженному референсу.
Для большинства задач — да: третье поколение стабильнее держит лицо и детали персонажа и умеет управлять ориентацией в кадре. Версия 2.6 остаётся разумным выбором для простых коротких проб, где важнее скорость экспериментов.