Gemini Omni: мультимодальная генерация видео с персонажами и голосом

Gemini Omni — мультимодальная нейросеть для генерации видео: на вход принимает не только текст, но и изображения, видео, аудио и даже сохранённых персонажей. Можно описать сцену словами, подкрепить её картинками, выбрать голос для реплик и снять серию роликов с одним и тем же героем — всё в одной модели.

Кадр из видео: полупрозрачные светящиеся листья папоротника и биолюминесцентные светлячки вокруг
Пример работы модели Gemini Omni на NeuralSpace

Что значит «Omni» на практике

Большинство видеомоделей принимает текст или одну картинку. Gemini Omni берёт смешанный вход: текстовое описание плюс до семи изображений, видео или аудио как дополнительный контекст. Хотите ролик «по мотивам» конкретного кадра, с настроением конкретной мелодии — приносите всё сразу, модель учтёт каждый источник.

Это меняет саму постановку задачи. Вместо длинного описания «представь себе такой-то дом, такой-то свет…» вы просто показываете фото дома, а словами задаёте только действие. Текст управляет сюжетом, вложения отвечают за облик — каждому типу входа своя работа.

Персонажи: один герой на все ролики

Главная беда обычных генераторов — герой меняется от ролика к ролику. Здесь это решено отдельной вкладкой «Character»: вы один раз создаёте персонажа, он сохраняется в вашу библиотеку, и дальше его можно подключать к любой генерации. Внешность остаётся стабильной от видео к видео.

Так собираются целые серии: виртуальный ведущий рубрики, маскот бренда, персонаж для детских историй. В форме генерации сохранённые герои выбираются одним кликом из библиотеки — не нужно каждый раз заново загружать референсы и надеяться, что модель «вспомнит» лицо.

Кадр из видео: пчела на месте бабочки после замены объекта
Пример работы модели Gemini Omni на NeuralSpace

Озвучка: готовые голоса и свои

Ролик может сразу выйти со звуком. В настройках есть набор готовых голосов — мужских и женских, разных по тембру и характеру: от мягких высоких до низких с хрипотцой. Выбираете голос, прописываете реплику в описании — и персонаж говорит прямо в кадре.

Если готовые варианты не подходят, во вкладке «Audio» создаётся собственный голос на основе базового пресета. Он тоже попадает в личную библиотеку и подключается к генерациям наравне со стандартными. Для бренда это возможность закрепить один узнаваемый голос за всеми видео.

Качество до 4K и форматы кадра

Gemini Omni — одна из немногих моделей на сайте с выводом в 4K: доступны разрешения 720p, 1080p и 4K. Длительность ролика — 4, 6, 8 или 10 секунд, соотношение сторон — горизонтальное 16:9 или вертикальное 9:16 под соцсети. Цена зависит от длительности и качества.

Практичный маршрут: черновики гонять в 720p, где генерация дешевле и быстрее, а финальную версию удачного варианта перезапустить в 1080p или 4K. Готовые ролики лежат в истории генераций — оттуда их можно скачать, продлить или повторить с правками описания.

С чего начать первую генерацию

Не подключайте все возможности сразу. Первый ролик сделайте из одного текста — так вы почувствуете, как модель понимает описания. Дальше добавьте картинку-референс, затем голос, и только потом заводите постоянного персонажа. Каждый шаг добавляет контроль, но требует чуть больше внимания к формулировкам.

В описании сцены держите классический порядок: кто в кадре, что делает, где происходит, как ведёт себя камера. Если есть реплика — выделите её отдельным предложением. Такая структура почти всегда даёт связный ролик с первой-второй попытки.

Частые вопросы

Чем Gemini Omni отличается от обычных видеомоделей?

Смешанным входом и библиотеками. Обычной модели дают текст или картинку, а здесь можно комбинировать текст, изображения, видео и аудио, плюс подключать сохранённых персонажей и собственные голоса. Это удобно для серийного контента с одним героем.

Как сделать несколько роликов с одним и тем же героем?

Создайте персонажа во вкладке «Character» — он сохранится в вашей библиотеке. Затем в каждой новой генерации выбирайте его одним кликом. Внешность героя будет повторяться из ролика в ролик без повторной загрузки референсов.

Будет ли в видео звук и речь?

Да. Выберите один из готовых голосов или создайте свой во вкладке «Audio», а реплику персонажа пропишите в описании сцены. Модель сгенерирует ролик, где герой произносит текст выбранным голосом.

Похожие модели