VEO 3.1 Reference To Video — режим генерации видео нейросетью, где главные не слова, а ваши изображения. Загружаете от одного до трёх референсов — товар, персонажа, стиль — и текстом описываете, что с ними должно происходить. Модель переносит узнаваемый объект в новую сцену вместо того, чтобы выдумывать его с нуля.

Обычная генерация каждый раз изобретает содержимое кадра заново: попросите «кроссовок на бегущем спортсмене» — и получите случайный кроссовок. Режим референсов решает эту проблему. Вы показываете модели конкретный объект на одном-трёх изображениях, и именно он оказывается в готовом ролике.
Референсы — это не первый и не последний кадр видео, а образцы: модель изучает, как выглядит ваш предмет или герой, и снимает с ним новую сцену по текстовому описанию. Загрузка хотя бы одного изображения обязательна — без референсов этот режим не запускается.
В классическом режиме «изображение в видео» картинка становится стартовым кадром, и всё действие разворачивается из неё: та же композиция, тот же ракурс. Референсный режим свободнее — сцена строится с нуля по вашему тексту, а изображения лишь диктуют, как должны выглядеть её участники.
Поэтому и задачи у режимов разные. Оживить конкретный снимок — это к обычному VEO 3.1. А вот показать ваш продукт в декорациях, где его никогда не снимали, или провести одного героя через серию разных роликов — это работа для Reference To Video.

Правило простое: модель должна хорошо разглядеть объект. Берите чёткие изображения, где предмет занимает заметную часть кадра, без лишнего визуального шума вокруг. Если объект сложной формы, помогают два-три ракурса — так модель поймёт его объём, а не только фасад.
В промпте не пересказывайте то, что и так видно на референсах, — опишите сцену и действие: где объект находится, что происходит вокруг, как движется камера, какой свет. Формат кадра выбирается в настройках: горизонтальный 16:9, вертикальный 9:16 или Auto.
Референсный режим работает исключительно на скорости Fast — выбрать Lite или Quality здесь нельзя, форма сама вернёт нужное значение. На практике это плюс: генерации выполняются быстро, и можно за короткое время перепробовать несколько сцен с одним и тем же набором референсов.
Стоимость ролика зависит от параметров генерации, оплата идёт в рублях с общего баланса токенов. Если видео не создалось — из-за фильтров или сбоя — токены не списываются. Действуют общие правила VEO: без детей в кадре, без жестокости к животным, без контента 18+.
Первый сценарий — товарка: у вас есть фото продукта, и вы снимаете с ним ролики для карточек, рекламы и соцсетей, не арендуя студию. Бутылка соуса на летнем пикнике, кроссовки на городской пробежке, крем на мраморной полке ванной — всё из одних и тех же референсов.
Второй сценарий — серийный контент с постоянным героем: маскот бренда, персонаж из ваших иллюстраций, узнаваемый предмет-символ. Один раз подготовив референсы, вы получаете целую линейку роликов, где герой остаётся собой от видео к видео. Готовые результаты хранятся в истории, их можно скачивать и продлевать.
От одного до трёх изображений, при этом хотя бы одно обязательно — без референсов режим не запустится. Для сложных объектов лучше дать два-три ракурса, чтобы модель точнее поняла форму.
Режим Reference To Video работает только на скорости Fast — это его техническое ограничение. Если выбрать другой вариант, форма автоматически вернёт Fast. Взамен вы получаете быстрые генерации и дешёвые итерации.
Модель сохраняет узнаваемость объекта, но это генерация, а не копирование: мелкие детали могут отличаться. Чёткие референсы с нескольких ракурсов повышают точность, а неудачный дубль можно просто перегенерировать.