← Все статьи

MiniMax H3: что умеет новая модель генерации видео

Нейросеть превращает идею в последовательность видеокадров

Коротко о главном (BLUF)

MiniMax H3 — новая модель генерации видео, которая делает ставку не на красивый стоп-кадр, а на непрерывное правдоподобное движение. Разбираем, что она умеет с текстом и несколькими картинками, где у 2K важная оговорка и как написать первый запрос.

Есть простой способ заставить видеонейросеть выдать себя: попросить не красивый портрет, а движение. Пусть ткань закручивается, камера облетает объект, вода ударяется о камень — и через секунду у слабой модели начинают плавиться края. MiniMax H3 интересна как раз тем, что разработчики сделали ставку не на один эффектный кадр, а на связное движение.

Мы посмотрели подробный разбор модели и отдельно сверили характеристики с официальной документацией. Ниже — без обещаний «убийцы кино»: что действительно заявлено, что полезно автору и где всё ещё нужен здравый скепсис.

Не просто текст и одна картинка

H3 принимает текст, изображения, видео и аудио в одной задаче. Можно начать с чистого запроса, оживить первый кадр, задать одновременно первый и последний кадры либо собрать ролик по референсам. У референса бывает конкретная роль: внешность героя, движение, траектория камеры, стиль, голос или ритм монтажа.

Это заметное изменение рабочего процесса. Вместо длинного описания «камера движется вот так, персонаж выглядит вот так» можно показать короткий пример движения и отдельную картинку со стилем. Модель получает меньше поводов угадать не то.

По официальной спецификации в одну reference-задачу входят до 9 изображений, до 3 видео и до 3 аудиофайлов; смешанный набор ограничен 12 файлами. Референсные видео и аудио суммарно могут длиться до 15 секунд. Промпт — до 7000 символов. Для обычного короткого ролика это даже с запасом.

Сложное движение и работа камеры в генерации MiniMax H3

2K есть, но есть важная оговорка

Модель выдаёт 768p или 2K, длительность задаётся целым числом от 4 до 15 секунд. Доступны обычные форматы кадра и адаптивное соотношение сторон. Для соцсетей 15 секунд уже хватает на законченный микросюжет: появление продукта, одно действие, реакцию и финальный план.

Но цифра 2K сама по себе не делает видео хорошим. В официальном процессе предусмотрена отдельная регенерация: удачный ролик 768p можно пересобрать в 2K, передав исходные условия и базовое видео. Это разумнее, чем дорого считать каждый черновик в максимальном разрешении. Сначала ловим движение, потом повышаем качество.

Где H3 выглядит убедительнее

В разборе особенно хорошо смотрятся сцены с быстрым движением камеры, жидкостями, тканью и несколькими согласованными источниками света. Ещё одна сильная сторона — связка визуального и звукового референса: автор может задать не только вид сцены, но и голос или музыкальный ритм.

Практический сценарий: есть фото товара, шестисекундный референс движения камеры и короткий звуковой акцент. Изображение задаёт предмет, видео — облёт, звук — момент кульминации. Такой пакет гораздо точнее голого запроса «сделай премиальную рекламу».

Где подвох

Последовательность персонажа стала лучше, но не превратилась в гарантию. Чем больше объектов сталкиваются, закрывают друг друга и возвращаются в кадр, тем выше шанс получить лишнюю деталь или скачок формы. Мелкий читаемый текст внутри сцены тоже лучше добавлять уже в монтажной программе.

И ещё: модель генерирует короткие клипы, а не готовый трёхминутный фильм. Длинную историю придётся разбить на планы, закрепить референсы и смонтировать. Это работа. Просто теперь большая часть черновых кадров делается быстрее.

Как написать первый запрос

Не набивайте его эпитетами. Дайте четыре вещи: объект, действие, камеру и свет. Например: «Стеклянный флакон стоит на мокром чёрном камне. Волна ударяет сзади, камера медленно обходит справа налево, холодный утренний свет, в финале крупный план». Если важен точный поворот камеры — приложите видео-референс. Если герой должен сохраниться — добавьте несколько изображений с разных ракурсов.

Хотите проверить идею на своём материале? Откройте генерацию видео в NeuralSpace. А если сначала нужно подготовить исходный кадр, его удобно собрать в генераторе изображений. Начните с 5–6 секунд в 768p: неудачный дубль будет дешевле, а удачный уже имеет смысл пересобрать крупнее.

Complex motion, fabric, water and camera movement in AI video generation
الحركة المعقدة والماء والقماش وحركة الكاميرا في فيديو الذكاء الاصطناعي
AI 视频中的复杂运动、水花、布料与运镜

Часто задаваемые вопросы (FAQ)

Вопрос: Как получить лучший результат от нейросети?
Ответ: Используйте подробные промпты (описания) на английском языке, задавайте стиль и детали сцены.

Вопрос: Можно ли использовать эти материалы в коммерческих целях?
Ответ: Да, сгенерированный контент полностью принадлежит вам.