建立可评审的基础构图
从主体、环境、取景和信息层级开始,在目标画幅中测试视觉重心。先确认故事和布局是否成立,再投入轮次修饰表面纹理。
GPT Image 2 把文字生成图片和参考图编辑放在同一个工作区里。你既可以从一段完整的视觉描述开始,也可以上传现有素材,要求模型保留人物、商品、排版或视觉风格。编辑模式最多支持 16 张参考图,每张图片不超过 10MB;输出可选择 1K、2K 或 4K,并提供正方形、竖版、横版、宽幅和全景等画幅。这样从概念探索、定向修改到交付检查都能沿用同一套输入,不必在不同工具之间重复整理要求。
围绕实际交付目标组合提示词、参考图片、画幅和分辨率。每项输入都应解决一个明确问题,而不是把互相矛盾的要求一次性塞给模型。
按重要程度描述主体、动作、环境、视角、构图、光线、材质和最终用途。先明确画面必须表达的内容,再补充风格细节,便于判断生成结果是否真正符合任务。
当人物身份、商品结构、姿势、布局、配色或质感需要继承现有素材时,可上传对应参考图。为每张图写清用途和优先级,避免多个来源争夺同一个细节。
可使用自动尺寸,也可选择常见的方形、竖版、横版、宽幅和全景比例。先确定图片将用于商品卡、海报、缩略图、横幅还是社交媒体,再决定安全留白和主体位置。
构图探索阶段可先用较低分辨率比较方向,等主体、排版和细节要求稳定后再提升到 2K 或 4K。这样更容易把修改集中在真正影响结果的地方。
一条可执行的请求需要区分必须保留、允许改变和最终验收的内容。先定义交付物,再组织参考图和提示词,后续每次修改才有清楚依据。
明确投放位置、目标受众、画幅比例、所需分辨率和视觉目标。商品详情图、活动横幅、社交帖子和编辑插画对构图、留白、文字密度的要求不同,不能只靠最后裁切解决。
先写主要主体和动作,再补充场景、镜头或视点、光线、色彩、材质以及限制条件。必须出现的文字或商品信息要准确写出,互相冲突的风格词应删去。
标明哪张图控制人物身份、商品形状、姿势、构图、配色或纹理。如果来源之间不一致,应说明以哪一张为准,而不是期待模型自动猜测。
分别检查主体准确性、手部与边缘、文字、品牌元素、空间关系和裁切安全区。每轮只改变一个主要变量,才能看清调整是否有效,并保留可继续编辑的最佳版本。
从主体、环境、取景和信息层级开始,在目标画幅中测试视觉重心。先确认故事和布局是否成立,再投入轮次修饰表面纹理。
需要保留人物、物体、商品或版式时切换到编辑模式,只上传相关参考图,并在提示词中分别列出要改变与必须保持不变的内容。
核对最终裁切、分辨率、细小边缘、嵌入文字和品牌一致性。选择适合实际页面或渠道的文件,不要用一个通用比例勉强覆盖所有用途。
在提交任务前核对文件数量、单图大小和输出目标,可以避免因输入不符合要求而中断,也能减少无关素材对编辑方向的干扰。
图片编辑模式一次最多接收 16 张参考图。数量是上限而不是目标;只上传能提供身份、形状、布局或风格依据的素材,通常更容易得到明确结果。
上传前检查每个文件的体积,单张图片必须控制在 10MB 以内。尺寸过大的素材应先合理压缩,同时保留关键轮廓、文字和需要模型识别的局部细节。
分辨率应与当前阶段匹配。1K 适合快速比较构图,2K 和 4K 更适合在方向确定后检查细节并准备交付,但高分辨率不会自动修复不清楚的提示词。
在生成前选择最终发布所需的比例,让人物、商品、文字区和背景留白从一开始就处于合适位置,避免后期裁切掉重要信息。
两种模式解决的问题不同。选择前先判断任务是创造一个全新方向,还是在现有视觉基础上做可控调整;所需积分以工作区当前选项的动态显示为准。
当手中没有必须继承的视觉素材,或希望快速探索多个创意方向时,从文字提示开始。重点描述目标、主体、构图和用途,而不是罗列大量互不相关的风格。
如果结果需要识别特定人物、产品、空间或版式,应上传参考图并明确哪些特征必须保持。参考图提供事实依据,提示词负责说明修改范围。
在方向尚未确定时,可优先比较构图、姿态和视觉层级。方案通过后再选择更高分辨率处理交付细节,避免把资源用在将被放弃的版本上。
不同模式、分辨率和当前模型配置可能对应不同积分消耗。提交前查看生成按钮附近的实时积分信息,不在页面正文中依赖容易过时的固定价格。
在明确商品比例、材质和品牌元素的前提下,探索展示场景、包装设计、背景与光线,并用参考图保持产品的可识别特征。
从一份视觉简报建立主画面,再按横幅、社交媒体、宣传页等不同位置调整构图与安全区域,保持同一活动的核心信息一致。
更换背景、造型、姿势、光线或构图时,明确指出原图中必须保留的人物、商品和品牌细节,避免整个场景被无意重做。
把抽象主题转化成具有清晰观点、视觉隐喻和出版尺寸的插图,并根据正文重点控制信息层级,而不是只追求装饰性画面。
为人物、地点、道具和关键情节建立视觉检查点,在扩大制作规模前统一服装、环境与叙事氛围。
构图获得确认后再提升至 2K 或 4K,检查边缘、文字、产品细节和裁切区域,为需要更多源像素的发布位置准备文件。
它支持文字生成图片和参考图编辑。你可以从提示词创建新画面,也可以上传素材要求保留或改变指定元素,并选择画幅以及 1K、2K 或 4K 输出。
编辑模式最多支持 16 张输入图片,每张不超过 10MB。实际使用时应优先选择目的明确的素材,并说明每张图分别控制身份、布局、商品或风格中的哪一项。
工作区提供自动尺寸,以及正方形、竖版、横版、宽幅和全景等常见格式,包括 1:1、3:2、2:3、16:9、9:16、2:1、1:2、3:1、1:3、21:9 和 9:21。
可以。选择编辑变体并上传源图,写明希望改变的区域、属性或氛围,同时列出人物身份、商品结构、构图或文字等必须保持不变的内容。
不一定。早期方案更适合先比较主体、构图和视觉方向,确定后再提高到 2K 或 4K。分辨率越高并不代表提示词理解会自动更准确。
从主体和期望结果开始,再补充环境、构图、视点、光线、配色、材质、必须出现的文字和限制。编辑任务还应把修改项与保留项分别列清楚。