最近我把 GPT Image 2.5 连续折磨了 6 次,就为了搞清楚一个所有 AI 绘画用户都挠头的问题:它能不能真的只改我让它改的地方?
答案是:能,但有前提。如果你把提示词写得像“这个画面太暗了,顺便把左边的东西去掉”这种含糊请求,那它基本会自作主张。但如果掌握了一些特定的指令技巧,它能做到让你意外的精准。这篇文章把我连续 6 次改图的完整过程、成功与失败的分界点,以及为什么你的 GPT Image 2.5 “不听话”的真实原因全部记录下来。
顺便说一句,现在 GPT Image 2.5 的定价体系已经变了,后面我会单独用一段说清楚它现在到底多少钱、怎么用最划算。
1. 为什么 GPT Image 2.5 总是改一个地方就破坏另一个地方?
先抛开那些“AI 理解人类语言”的玄学说法,从技术底层看,GPT Image 2.5 是基于扩散 Transformer 架构的图像生成模型。它不是一个 Photoshop 式的图层编辑器,没有“锁定图层”的概念。你给它一张图,它读取的是整张图的视觉 token,在生成时是一次性重建整幅画面的所有区域。
1.1 模型并行重绘的“连带污染”原理
这就好比你把一幅油画递给一位画师,说“帮我把天空改蓝一点”,画师为了保持整体协调,会把云朵的亮度、远山的色调、甚至草地上的反光都顺手调一遍。GPT Image 2.5 也是如此——它在重绘时是全局并行采样,修改目标区域的同时,它认为“应该保持一致”的其他区域也会被重新采样,于是产生了连带污染。
我在实测中遇到最典型的情况是:让 2.5 把人像的右手臂改细一点,结果它不仅改了手臂,把衬衫袖口的纹理、背景墙壁的阴影位置全部重画了一遍,整体风格看起来似乎没变,但细节完全变了。这就是因为袖口和手臂在视觉 token 上高度相关,模型在全局采样时把这种相关性理解为“需要一起更新”。
1.2 文本指令的注意力权重分配机制
另一个关键机制是cross-attention(交叉注意力)。你在对话框里输入的文字提示词,会被分解成 token,在去噪过程中,每个 patch(图像块)都会去匹配文本 token 的注意力权重。问题就出在:模型对提示词中的形容词和动词的响应权重,远超对范围限定词的响应权。
比如你说“把红色杯子换成蓝色”,模型对“红色”和“蓝色”的注意力极高,会精确重绘杯子;但如果你说“只把杯子换颜色,其他什么都不要动”,“只”和“其他”这类限定词的注意力权重在视觉解码时会被大幅稀释,甚至在某些层被忽略。这就导致模型“听懂”了换颜色,却没听懂“别动其他东西”。
2. 连续 6 次改图的实测复盘:它到底改对了哪几次?
先交代一下我的测试环境:我用的是 GPT Image 2.5 的 Web 端原版(不是 API 接第三方套壳),输入是一张室内植物角落的摄影图,画面里有:一盆龟背竹、一张原木色边几、一本摊开的杂志、背景白墙上有两幅挂画。
我在保持原图基础不变的前提下,连续 6 次尝试修改细节,全程记录每次改图是否动了非目标区域。
2.1 测试一:“把龟背竹叶片颜色改深一点” —— 失败
第一次我按照最自然的直觉提问:“把画面里龟背竹的叶片颜色改深一点,其他不变。”
结果:叶片确实变深了,但同时边几和杂志上的暖色反光也被加深,墙上的挂画颜色整体重绘,饱和度明显提高。非目标区域被改动的程度约 70%,对这张图来说,基本等于重画了一张“颜色更深版本”的完整图。
失败归因:提示词含 “颜色” 和 “深一点” 两个强注意力词,模型全局调整了色调平衡,没有做局部 mask。
2.2 测试二:“只改变龟背竹叶片的绿色饱和度” —— 部分成功
这次我刻意加了“只”字,并且把范围收敛到“绿色饱和度”。结果叶片颜色更浓郁,但杂志封面上的红色小标签也被同步加深了饱和度。边几木纹的变化不大,挂画基本没动。
可以说非目标区域被扰动约 30%,比第一次好很多,但还没有达到“只改目标”的精度。
2.3 测试三:指定精确区域 + 外扩边界描述 —— 成功
第三次我学乖了,我把目标直接拆成“物理坐标感”的描述:“画面左下角那盆龟背竹,从花盆里长出来的所有叶片,只调整它们的绿色饱和度和亮度,桌面上其他物品保持完全一致。”
结果出乎意料地精准。叶片本身颜色更深、更鲜亮,边几、杂志、挂画、白墙全部保持原样。我放大对比了前后两张图的杂志封面文字细节,几乎没有发生形变。
这是我第一次确认:只要把“位置锚点 + 范围边界 + 属性变化 + 排除项”写清楚,它是可以做到局部编辑的。
2.4 测试四:改完叶片后再改花瓶 —— 灾难
我再接再厉,在测试三结果图上继续输入:“把旁边那个原木色边几改成一个白色圆形小茶几,其他的不变。”
这次直接翻车。模型不仅改了边几,还把整个画面右下角的地面纹理重绘成木地板(原图是哑光灰砖),杂志被“顺带”换成了一个小花瓶,墙上挂画的角度都变了。
深层原因:测试三已经让模型对全图做了重新采样,画面里除了目标区域,其他区域都是“新生成的伪一致状态”。这时候你再提修改要求,模型会把上一轮的已有结果当成一次性起点,而不是“必须保留的原始样本”。它会在保留大致构图的前提下,重新脑补整个场景的材质逻辑——只因为原木色边几改成白色茶几,这个动作改变了空间的明暗平衡,模型觉得“地面也得亮一点才合理”。
2.5 测试五:颜色描述方式 —— 失败
这次我回到最初始的图(注意,是重新上传原图,不是接着上一轮改),要求“把杂志封面的主色调从暖黄色改为深蓝色,其他元素不动”。
结果:杂志封面确实变成深蓝,但同时墙上一幅挂画的边框从黑色变成了深蓝色,边几上的小瓷碗边缘也被染成蓝边。模型显然把“深蓝色”当成了场景中的一个“风格统一元素”扩散了开来。
这暴露了一个非常关键的规律:2.5 对“颜色”这类全局特征的跨区域扩散控制能力偏弱。当你说“把某个物体改成蓝色”,它会尽量识别该物体的语义,但颜色在视觉知识里被编码为“可迁移的属性”,容易向邻近的、材质相似的区域传播。
2.6 测试六:用负面提示词明确排除 —— 成功
最后一次,我同时用“正向指令 + 负面排除”(就是在描述时明确说不要动哪几个元素),原文如下:
“把画面中龟背竹的花盆换成黑色陶瓷花盆,仅限于花盆这一物体。不要改变龟背竹的叶片形态,不要改变边几材质,不要改变杂志封面内容,不要改变白墙颜色和挂画内容。”
结果这次不仅花盆换成了黑陶质感,且所有非目标物体维持了极高的一致性。我把改图和原因放大 200% 逐像素对比,杂志标题字母的边缘锯齿、挂画底框的细裂纹都原封不动,连叶片的高光分布都没变。
我实测后在笔记里写下这么一句话:GPT Image 2.5 的局部编辑能力是“条件性精准”,不是“默认精准”。你必须在每一步把条件列清楚,模型才会严格收敛到目标区域。
3. 实测后总结出的“GPT Image 2.5 局部修改指令黄金模板”
如果你直接拿去用,前面那些试错结果就白费了。我把 6 轮实测中“最有效”的指令范式拆解成一套可复制的模板。核心原则就一句话:
你要像项目经理给外包团队下需求一样,把“对象、范围、属性、排除项”一次说清。
3.1 高成功率指令结构化公式
一个高成功率的局部修改提示词,应该包含以下几个结构块:
- 位置锚点:明确目标物体在画面中的位置(左、右、上、下、中间、背景、前景),不要只依赖模型自己“看图识别”,最好同时在一条 prompt 里描述相对位置关系,例如“画面右侧那盏台灯”。
- 对象范围:是修改物体的整体,还是只改局部部件(例如“仅台灯的灯罩”“仅花盆的盆身”)。
- 属性变化:具体改什么属性——颜色、形状、材质、尺寸(用相对量词如“稍微变大”“显著加深”或具体数值如“直径扩大 20%”)。
- 不变项排除列表:明确列举不希望改动的元素,越多越好,模型对排除列表的遵循度比正向指令更有效,因为它的注意力会从这些对象上撤离,而不是额外关注。
- 风格保持短语:加在末尾,比如 “保持原图的摄影质感、光线方向和画面比例不变”,这能让 token 归一化到原图的风格空间,有效抑制全局重绘扩散。
我自己用的最多的高成功率句式如下,可以直接抄:
“画面中的【位置锚点】的【对象范围】,把它的【属性变化】改成【目标状态】,需要注意:【不变项1】、【不变项2】、【不变项3】都不要发生改变,最后保持整张图的【风格描述】不变。”
3.2 实拍案例:把单人照背景里的一盆绿植移除,不动人物
再举一个测试更贴近真实用户需求的例子。一张办公桌前的单人照,背景角落有一盆绿植。我的指令是:
“只移除画面左侧背景里的绿植,绿植原来所在的区域用背景墙的颜色和纹理自然填充。人物、桌面上的所有物品、参考线的透视关系、人物身上的明暗关系全部保持不变,画质必须保持清晰真实,不允许产生涂抹痕迹。”
结果:绿植被干净地移除,填充区域和原墙的纹理基本无缝衔接。人物呢,衣袖上的褶皱、脸部的明暗分界线都没有变化,连桌面角落那根电源线的弧度都保持住了。
这说明当模型接受“新增一个非视觉对象的语义掩码任务”时,它对剩余区域的保护会更强,因为填充与保护本身是一对任务;但如果你只要求改颜色或材质,这种“保护性”就会减弱。
3.3 在实际改图中要主动避开的“触发词汇”
经过 6 轮测试,我发现下面的词汇会极大地引发全局扩散,尽量少用或修改说法:
| 容易引发全局重绘的用词 | 替代说法(收敛范围) |
|---|---|
| 整个画面 | 删除,改为具体物体名 |
| 风格改成 | 作为最后一个补充短语,紧跟在目标物体之后 |
| 变亮/变暗 | 加上物理范围:“【某物体】表面的亮度” |
| 氛围感、高级感 | 不描述抽象感觉,只描述材质与光照:“强调表面的哑光质感” |
| 顺便、也 | 尽量不要在一个请求里同时修改多个不相干物体 |
| 修复一下 | 永远不要用,模型会重建全图 |
如果你已经把“正面提示词”写到极限了,但还是出现全局重绘,可以在下一轮对话里输入:“请只参考上一张图的未被修改部分,仅更新指定区域,其他区域直接保留原图像素。” 这句话能明显降低重绘率,但无法做到 100% 像素级锁定——毕竟底层架构就没有掩码锁定。
4. 从 GPT-1 到 2.5:指令遵循能力到底进化了多少?
我拿 GPT-1 Image(还记得那个除了翻车不会干别的初代吗)、GPT-4o 图像版、还有 GPT Image 2.5 分别跑过同一张图的局部修改任务。
4.1 三代模型在同一指令下的表现差异
用一句“把咖啡杯左边的红色餐巾改成蓝色餐巾,其他保持不变”作为标准测试。
- GPT-1 时代:基本是整个画面被推翻重画,或者只改变画风,目标物体的颜色根本没变。它更像“输入文本生成全新图像”,而不是“编辑现有图像”。
- GPT-4o 图像版:能识别到红色餐巾,会改成蓝色,但同时会把桌面木纹、背景灯光色调一起改一遍,非目标区域扰动大,约 50%-60%。
- GPT Image 2.5:如果你给足排除列表,非目标区域扰动低于 10%,甚至能保留杂志文字、细小裂纹、物体表面的污渍等微观细节。这是 4o 版本做不到的。
- 不过,2.5 的“图像退化”现象比 4o 更明显:在多次连续编辑后,画面会逐渐变得“塑料感”、锐度过高,就像修图软件反复涂抹后丢失质感。所以连续改图超过 3 轮后,建议回到原图重新开始,而不是一直叠加编辑。
4.2 2.5 的“显著进步”和“隐藏短板”
显著进步在于它对空间指令的响应精度有了质变。模型似乎经过了更多的多模态指令微调,能够理解“左边、右边、最上方、靠近窗户那一侧”这类方位描述,并能准确定位对象。
隐藏短板也很明显:它对“程度”的感知偏弱。“稍微”“一点”“大幅度”这类相对量词,被解读成什么程度完全看心情。实测“把叶片颜色稍微加深”,最终效果接近了“显著加深”;说“稍微调亮”,直接变成了曝光过度。
我的建议是:不要用模糊的程度词,要么给一个具体的参考状态,例如“饱和度与另一个物体的相似度一致”,要么直接给数值,例如“把亮度降低 20%、对比度提高 10%”,模型对精确比例的响应反而更有效。
5. 一些不用花钱反复试错就能跑通的经验技巧
如果你手头没有 GPT Image 2.5 的权限,想先验证自己的编辑指令稳不稳,可以用一个免费思路做替代测试:把原图和上一轮结果图同时丢给它,要求它“对这两张图进行差异分析,并基于目标描述来统一修改——不要改变除了指定对象之外的任何区域。” 这个方法能让模型先做一次逻辑一致性对齐,然后再编辑,准确率会明显提高。
5.1 技巧一:用多轮对话逐步锁定编辑范围
不要试图一步到位。分步改场景反而比一次全改完的最终质量高很多。我的建议顺序是:
- 第一步,先只说“不要改动整个画面的构图、透视和主要物体的位置关系”。
- 第二步,再指定第一个修改对象和属性变化。
- 第三步,等模型输出后,再追加第二个修改对象。
- 最关键:每一步之间不要加“顺便”“同时”这类并列词,这会导致模型一次重建多个区域。
多轮对话中有一个隐藏风险:模型对上一轮图片的“记忆”并不是像素级存储,而是语义级存储。如果你在第 3 轮修改时发现第 1 轮的改动被“还原”了,不用惊讶,它的上下文窗口里存的是压缩后的语义特征,不是原图片。解决办法是每次修改前都重新上传最新的图,不要依赖对话历史。
5.2 技巧二:把“排除列表”放在提示词的中后段
测试发现,排除列表如果放在提示词开头,模型容易觉得这是主要任务,反而去“重点检查”那些要排除的元素;放在后段,模型会把它当作纠正项来理解——它优先完成正向指令,再用排除列表约束采样方向。我试过调整顺序后,非目标区域的被改动率从 30% 降到了 12%。
这背后的逻辑是,提示词中越靠前的 token 具有越高的注意力权重分配。放在后段不会变成主要修改对象,但会作为解码阶段的 soft constraint 起作用,约束它不去碰那些区域。
5.3 关于“GPT Image 2.5 价格”,我的建议和避坑提醒
这个问题最近很多人问,因为各家第三方分销平台报价差距极大。先说官方渠道的路子:GPT Image 2.5 在 OpenAI 的 API 里是按照按图计费的,每生成或编辑一张图消耗固定数量的 token,价格随分辨率档位浮动,大致落在 0.04 到 0.2 美元一张图的区间。低分辨率快速模式便宜,高清和多次编辑叠加会更贵,灵活度比订阅制高。
如果你用的是官网订阅账号(Plus 或 Pro),那么图像生成本身不另外按张收费,包含在订阅里——但这不等于无限用,订阅档位下有速率限制,连续跑几十张图后会被限流,弹窗让你等几分钟。
第三方转售平台则是五花八门,有的按次收,有的按积分收,有的一张标价低到离谱,但背后往往挂着低速队列或画质降级。我的建议很明确:认准官方接口或官方订阅,至少合规性和画质有保证。就按“按图计费”来算,一张图几毛钱人民币,真的不贵,没必要去省这点钱把自己的 API Key 环境搞得不安全。
我在早期就踩过坑,在某平台上买过大量号称超低价的图像生成额度,最终因为分辨率被后台压缩,白白损失了一批项目素材的精度。从那以后我再也没碰过那些没有明确 API 解析来源的分销商。
6. 最后再补几个实际使用过程中很有用的边界判断标准
如果你也在用 GPT Image 2.5 做设计改图、电商素材、表情包微调或者摄影后期,我的最后一条建议是:不要把它当 Photoshop 用。
它适合的场景是“基于一张有明确视觉主体的图,做风格微调、元素替换、局部色彩变化”,而不是“把画面里的三个物体分别精确改三次,互不影响”。后者你可能真要等到原生语义编辑能力的模型换代。
另外一个小冷知识:如果你必须要多次编辑且不想累计叠加画质损失,可以在每次输出后保存一份,重新上传原图并附上“参考这张图完成……保持与原图完全一致的材质和光影”,这样能明显抑制“多轮重生塑料感”。我自己在高精度素材需求下,通常不会让一张图经过超过两次连续编辑。
最后分享一个我很常用的保底技巧:在输入框末尾加一句“请以原图作为最高优先级的视觉参考”。这句话不算万能,但在 2.5 上对局部保护的提升是有肉眼可见效果的。毕竟模型说到底是个概率采样器,你给它越强的“原图保护信号”,它就越不敢脱离原图放飞自我。