GPT Image 1.5 — генерация изображений нейросетью, которая по-настоящему читает ваш запрос. Ей можно дать длинное описание с десятком условий — кто стоит слева, что написано на кружке, какое время суток за окном — и она соберёт всё в один кадр. Работает в браузере с единым балансом токенов, каждая картинка остаётся в истории.

Большинство генераторов ловят из описания два-три ключевых слова, а остальное додумывают. GPT Image 1.5 построена на языковой модели, поэтому держит в голове весь текст: порядок предметов, их количество, взаимное расположение и даже логику сцены. Попросите рыжего кота на подоконнике, зелёную чашку слева от ноутбука и дождь за окном — получите именно это.
Такая точность экономит попытки. Вместо серии перегенераций в надежде на удачу вы один раз подробно формулируете задачу — и правите мелочи, а не переделываете всё с нуля. Это особенно заметно на сценах с несколькими людьми, интерьерах с конкретной расстановкой мебели и иллюстрациях к тексту, где важен каждый описанный элемент.
Пишите обычными предложениями, как объясняли бы художнику: что происходит, кто участвует, откуда свет, какое настроение. Не бойтесь длины — чем конкретнее запрос, тем меньше модель фантазирует. Писать можно и по-русски, и по-английски: смысл она понимает на обоих языках.
Полезный приём — идти от общего к частному: сначала сцена и композиция, затем детали персонажей, в конце стиль и атмосфера. Если результат почти устроил, не начинайте заново: скопируйте промпт из истории, поменяйте одну-две фразы и запустите снова. Так за пару итераций описание доводится до точного попадания.

Модель принимает до 16 своих изображений размером до 10 МБ каждое. Это открывает сборные сценарии: положите фото товара, пример желаемого фона и картинку с нужной цветовой гаммой — модель объединит их по вашей инструкции. Или загрузите несколько ракурсов одного предмета, чтобы она точнее поняла его форму.
Референсы работают и как основа для правок: загрузите снимок и опишите словами, что изменить — убрать лишнее со стола, заменить одежду, перекрасить стены. Чем яснее инструкция, тем аккуратнее правка. Итог, как обычно, попадает в историю, откуда его можно скачать или отправить на следующий круг доработки.
Доступны три соотношения сторон: квадрат 1:1, вертикальный 2:3 и горизонтальный 3:2. Квадрат удобен для аватарок и постов, вертикаль — для портретов и карточек в ленте, горизонталь — для обложек статей и презентаций. Формат выбирается в форме до запуска.
Качество переключается между Medium и High. Medium быстрее и подходит для черновиков, подбора композиции и генераций «на посмотреть». High даёт более проработанную картинку — его стоит включать для финальных версий, крупных планов и всего, что пойдёт в печать или на видное место. Цена зависит от выбранного качества.
Сильнее всего модель показывает себя там, где важно точное следование техзаданию: иллюстрации к статьям с конкретным сюжетом, сцены с несколькими персонажами, инфографические зарисовки, кадры для сторибордов. Дизайнеры используют её для быстрых макетов: описал экран, обложку или упаковку — получил заготовку для обсуждения.
Для магазинов это способ примерить товар в антураже: загрузите фото продукта и попросите поставить его на мраморный стол у окна или в руки модели. Для блогеров — фабрика уникальных обложек, которые точно совпадают с темой поста, а не «что-то около». Начните с простого запроса и усложняйте, пока не увидите предел.
До 16 изображений за одну генерацию, каждое до 10 МБ. Их можно комбинировать: товар с одного фото, фон со второго, палитра с третьего. В описании поясните, какую роль играет каждая картинка, — так модель точнее поймёт замысел.
High даёт более детализированную картинку и обходится дороже, Medium — быстрее и экономнее. Разумная тактика: искать композицию и проверять идеи на Medium, а финальный вариант перегенерировать на High тем же промптом из истории.
Да, модель понимает русский текст, включая длинные подробные описания. Пишите так, как объясняли бы задачу живому иллюстратору: полными предложениями, с деталями о расположении предметов, свете и настроении сцены.