SeeDance 2.0 — omni-нейросеть для генерации видео: на вход она принимает не только текст, но и изображения, видеофрагменты и аудио одновременно. Это значит, что сцену можно собрать из готовых кусочков — показать модели героя на фото, задать движение видеореференсом, подложить звуковую дорожку и словами объяснить, что со всем этим сделать.

Обычные генераторы понимают либо текст, либо одну картинку. SeeDance 2.0 принимает несколько типов материалов сразу и рассматривает их как единое задание. Фотография задаёт внешность персонажа или предмета, видеоролик — характер движения или стиль съёмки, аудио — ритм и атмосферу, а текст связывает всё вместе и уточняет детали.
На практике это снимает главную боль генерации: раньше приходилось описывать словами то, что проще показать. Теперь вместо абзаца про «плавную съёмку с проездом камеры слева направо» достаточно приложить короткий пример такого проезда. Чем меньше модель додумывает, тем ближе результат к тому, что вы задумали.
Главный козырь версии 2.0 — постановочные сцены, где взаимодействуют несколько объектов. Например: два персонажа с разных фотографий встречаются в одном кадре, товар из предметной съёмки оказывается в руках у человека, машина из референса едет по улице, описанной текстом. Модель удерживает внешность каждого элемента и при этом строит связное действие.
Такие задачи раньше требовали монтажа и композитинга, а здесь решаются одной генерацией. Хорошо получаются рекламные постановки: продукт, персонаж, окружение и настроение задаются разными файлами, а вы управляете только сценарием. Если какой-то элемент «уплыл», уточните его роль в тексте — кто главный в кадре и что он делает.

Начните с текста: опишите сцену так, будто объясняете её режиссёру. Затем добавьте файлы и в описании ссылайтесь на них по смыслу: «человек с первого фото сидит за столом», «камера двигается как в приложенном видео». Не загружайте лишнего — каждый референс должен отвечать за что-то конкретное: внешность, движение, звук.
Аудио стоит добавлять, когда ролик делается под готовую музыку или закадровый голос: движение в кадре подстроится под дорожку, и клип будет ощущаться смонтированным, а не случайным. В форме также выбираются формат кадра, длительность и качество; для быстрых черновиков есть ускоренный режим, для финала — более тщательный.
Рекламный ролик, где ваш товар снят «как в кино»; клип под трек, попадающий движением в бит; продолжение уже отснятого видео в том же стиле; сцена с постоянным героем для серии роликов; ожившая раскадровка из нескольких эскизов. Всё это — задачи с несколькими исходниками, и именно на них omni-подход раскрывается полностью.
Каждая генерация попадает в историю: ролик можно скачать, продлить, забрать последний кадр под следующую сцену или повторить запрос с правками. Стоимость зависит от длительности и качества и списывается с единого баланса токенов — того же, что и у остальных инструментов сайта.
Нет, модель умеет работать и по чистому тексту. Но её сила именно в комбинировании: фото героя плюс видеопример движения дают гораздо более управляемый результат, чем любое, даже очень подробное, словесное описание.
Модель старается переносить черты лица и одежду с референса в кадр, и обычно герой остаётся узнаваемым. Для лучшего результата берите чёткое фото анфас без сильных теней и не перегружайте сцену другими персонажами.
V1 принимает только текст или одну картинку и годится для простых роликов. Версия 2.0 работает с несколькими типами входа сразу — изображения, видео, аудио — и заметно лучше справляется со сложными многосоставными сценами.