Gemini Omni — мультимодальная нейросеть для генерации видео: на вход принимает не только текст, но и изображения, видео, аудио и даже сохранённых персонажей. Можно описать сцену словами, подкрепить её картинками, выбрать голос для реплик и снять серию роликов с одним и тем же героем — всё в одной модели.

Большинство видеомоделей принимает текст или одну картинку. Gemini Omni берёт смешанный вход: текстовое описание плюс до семи изображений, видео или аудио как дополнительный контекст. Хотите ролик «по мотивам» конкретного кадра, с настроением конкретной мелодии — приносите всё сразу, модель учтёт каждый источник.
Это меняет саму постановку задачи. Вместо длинного описания «представь себе такой-то дом, такой-то свет…» вы просто показываете фото дома, а словами задаёте только действие. Текст управляет сюжетом, вложения отвечают за облик — каждому типу входа своя работа.
Главная беда обычных генераторов — герой меняется от ролика к ролику. Здесь это решено отдельной вкладкой «Character»: вы один раз создаёте персонажа, он сохраняется в вашу библиотеку, и дальше его можно подключать к любой генерации. Внешность остаётся стабильной от видео к видео.
Так собираются целые серии: виртуальный ведущий рубрики, маскот бренда, персонаж для детских историй. В форме генерации сохранённые герои выбираются одним кликом из библиотеки — не нужно каждый раз заново загружать референсы и надеяться, что модель «вспомнит» лицо.

Ролик может сразу выйти со звуком. В настройках есть набор готовых голосов — мужских и женских, разных по тембру и характеру: от мягких высоких до низких с хрипотцой. Выбираете голос, прописываете реплику в описании — и персонаж говорит прямо в кадре.
Если готовые варианты не подходят, во вкладке «Audio» создаётся собственный голос на основе базового пресета. Он тоже попадает в личную библиотеку и подключается к генерациям наравне со стандартными. Для бренда это возможность закрепить один узнаваемый голос за всеми видео.
Gemini Omni — одна из немногих моделей на сайте с выводом в 4K: доступны разрешения 720p, 1080p и 4K. Длительность ролика — 4, 6, 8 или 10 секунд, соотношение сторон — горизонтальное 16:9 или вертикальное 9:16 под соцсети. Цена зависит от длительности и качества.
Практичный маршрут: черновики гонять в 720p, где генерация дешевле и быстрее, а финальную версию удачного варианта перезапустить в 1080p или 4K. Готовые ролики лежат в истории генераций — оттуда их можно скачать, продлить или повторить с правками описания.
Не подключайте все возможности сразу. Первый ролик сделайте из одного текста — так вы почувствуете, как модель понимает описания. Дальше добавьте картинку-референс, затем голос, и только потом заводите постоянного персонажа. Каждый шаг добавляет контроль, но требует чуть больше внимания к формулировкам.
В описании сцены держите классический порядок: кто в кадре, что делает, где происходит, как ведёт себя камера. Если есть реплика — выделите её отдельным предложением. Такая структура почти всегда даёт связный ролик с первой-второй попытки.
Смешанным входом и библиотеками. Обычной модели дают текст или картинку, а здесь можно комбинировать текст, изображения, видео и аудио, плюс подключать сохранённых персонажей и собственные голоса. Это удобно для серийного контента с одним героем.
Создайте персонажа во вкладке «Character» — он сохранится в вашей библиотеке. Затем в каждой новой генерации выбирайте его одним кликом. Внешность героя будет повторяться из ролика в ролик без повторной загрузки референсов.
Да. Выберите один из готовых голосов или создайте свой во вкладке «Audio», а реплику персонажа пропишите в описании сцены. Модель сгенерирует ролик, где герой произносит текст выбранным голосом.