核心要点 (BLUF): GPT图像1.5是一个AI图像生成器,实际上可以读取您的整个提示。把一份长长的简报交给它,其中包含十几个条件——谁站在左边,杯子说什么,透过窗户看到的天气——它就会组成一个框架来纪念所有这些条件。它在浏览器中运行,每个结果都会保存到您的历史记录中。

大多数生成器都会抓住两个或三个关键字并即兴创作其余的。 GPT图像1.5构建在语言模型上,因此它跟踪整个文本:对象顺序、计数、空间关系,甚至场景的逻辑。要求窗台上有一只姜黄色的猫,笔记本电脑上留下一个绿色的杯子,外面下着雨——这就是你得到的。
这种精确度可以节省尝试次数。您不必在多次再生中掷骰子,而是写一份完整的摘要,然后调整一些小事情,而不是重新开始。这种差异在多人场景、具有特定家具放置的室内以及每个描述的元素都很重要的编辑插图中最为明显。
用简单的句子写,就像向人类插画家介绍:发生了什么、涉及谁、光线从哪里来、心情如何。长度在这里是一种资产——请求越具体,模型自己的即兴发挥就越少。
有用的模式是从一般到具体:首先是场景和构图,其次是人物细节,最后是风格和氛围。当结果几乎正确时,不要从头开始 - 从历史记录中复制提示,更改一两个短语并重新运行。几次迭代通常会使概要达到准确的效果。

该模型最多接受 16 张图像,每张图像最多 10 MB。这解锁了合成工作流程:放入产品照片、您想要的背景示例以及具有正确色调的图片,然后告诉模型如何将它们组合起来。一个物体的多个角度有助于它掌握形状。
参考文献还可以为编辑提供动力:上传一张照片并用文字描述变化——清理桌子、交换服装、重新粉刷墙壁。指令越清晰,编辑就越干净。结果会记录在您的历史记录中,可供下载或发送另一轮优化。
提供三种帧格式:方形 1:1、纵向 2:3 和横向 3:2。方形适合头像和提要帖子,适合人物和产品卡的肖像作品,适合文章封面和幻灯片的横向作品。您在生成之前在表单中选择格式。
质量在中和高之间切换。 Medium 对于草稿、构图搜索和快速预览来说速度更快、效果更好。 High 可生成更精致的图像 - 切换到它以获取最终版本、特写镜头以及任何需要打印或突出放置的内容。价格取决于您选择的质量。
在忠实执行规范的情况下,它表现最佳:特定于故事的文章插图、多角色场景、信息图表风格的草图、故事板框架。设计师使用它来快速制作模型——描述一个屏幕、一个封面或一个包装,并一次性获得可讨论的草稿。
对于商店来说,这是一种展示产品的方式:上传照片并要求将其放在靠窗的大理石桌子上,或者放在模型手中。对于博主来说,它是一个与帖子主题完全匹配而不是近似匹配的封面工厂。从简单开始,不断添加条件,直到找到上限。
每代最多 16 个,每代最多 10 MB。您可以混合角色:一张照片中的产品、另一张照片中的背景、第三张照片中的调色板。在提示中解释每个图像的用途,模型将相应地组合它们。
高渲染更多细节,成本更高;中型更快、更便宜。实用的例程:在 Medium 上探索作品,然后从 High 的历史记录中重新生成最终版本的获胜提示。
有了这个模型,是的。它特别擅长同时控制多种条件,因此有关放置、照明和情绪的额外细节可以转化为控制而不是混乱。模糊的俏皮话浪费了它的主要优势。