ChatGPT Images 2.5上线:生成更快、改图更稳,支持草图参考和图片批注
生成更快,改图更稳
OpenAI 最近发布了 ChatGPT Images 2.5,这是继今年早些时候推出 Images 2.0 后的又一次重要更新。这次升级没有追求更高的输出分辨率(仍为最高 3840px),而是把精力放在了实际使用中最让人头疼的问题上:生成速度、细节还原和反复修改时的一致性。

官方称,相比 Images 2.0,Images 2.5 的生成延迟最多可降低 50%。听起来不如“画质炸裂”那么吸引眼球,但对每天要生成几十上百张图的用户来说,少等一半时间意味着工作流能顺畅不少。尤其是在强调多轮编辑的新功能下,速度提升显得尤为关键。

除了快,这次还新增了 xhigh 和 max 两个质量档位。它们不改变图片尺寸,而是进一步优化材质纹理、光照效果和参考主体的特征保留。比如给一张小孩的照片换衣服,原来卷曲略带毛躁的发质能更完整地保留下来,而不是被 AI “顺滑”成另一种发型。

不过也不是每处都完美。有测试显示,给小狗穿上衣服后,身体轮廓变了,但影子却还保留着没穿衣服时的形状——这种细节上的逻辑断裂,说明模型对物理关系的理解仍有局限。

草图当参考,圈哪改哪

Images 2.5 加入了两个很实用的新交互方式。

第一个是支持用户上传手绘草图作为视觉参考。当你脑子里有明确构图,但找不到合适的照片时,可以直接在对话框里用鼠标随便画个轮廓,再配上文字描述风格和细节,AI 就会基于这张草图生成完整图像。这对概念设计或快速原型特别有用。

第二个是图片批注功能。以前想改图里某个具体位置,得写一大段话:“请把画面左上角第二个人脸上的墨镜换成黑框眼镜”。现在可以直接在图上圈出那个区域,写一句“换成黑框眼镜”,AI 就知道你要改哪里。尤其当一张图里人物或物体很多时,这个功能省去了大量沟通成本。

这两个功能加在一起,让图像生成从“抽卡式碰运气”逐渐转向“定点修改”的工作模式。你不再需要反复调整提示词去猜 AI 的理解,而是可以直接指出问题所在。

多轮编辑不再“拆东补西”

过去用 AI 生图,最让人崩溃的场景之一是:第一轮生成主体没问题,第二轮改背景时主体变形了;第三轮好不容易把主体修回来,排版又乱了。改着改着,前面已经确认好的内容又被动了。

Images 2.5 特别强调了多轮编辑中的一致性。OpenAI 表示,在长对话中,模型能更好地记住之前已经确认的元素,并在此基础上继续修改。比如做一套不同城市的旅行海报,版式固定,只需替换城市名、照片和路线信息。现在可以先换目的地,再单独调整某段文字,而不会影响其他已定稿的部分。

官方展示了一组电商场景的演示:同一个人物不断更换服装和背景。虽然部分图像仍有轻微的“AI 塑料感”,但人物比例、姿态和与环境的空间关系比之前更稳定。尤其对比 Images 2 和 2.5 的输出,后者在人物与物体的比例协调上进步明显。

不过也有用户反馈,细节提升的同时,人物肢体偶尔会出现新的扭曲。这说明模型在局部精细控制和整体结构稳定性之间还在找平衡。

API 分高低,价格统一

面向开发者,OpenAI 同步推出了两个 API 模型:GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst。

Flare 定位为通用型,强调质量、编辑能力和速度的平衡,适合社交内容生成、快速视觉原型或大批量图像生产。Sunburst 则针对高精度需求,比如正式投放的广告、产品主图或对画质要求严苛的创意项目。









有趣的是,尽管定位不同,两者目前采用相同的 token 计费标准:文本输入 5 美元/百万 tokens,图像输入 8 美元/百万 tokens,图像输出 30 美元/百万 tokens。这意味着开发者可以根据任务复杂度选择模型,而不必担心计费差异。
此外,ChatGPT 现在终于支持显示图像生成的百分比进度条。用户不用再靠发“在吗”来判断网络是否断连,体验细节上的小改进其实很贴心。
实测:材质扎实了,但仍有涂抹感
从社区实测来看,Images 2.5 在材质表现上确实有肉眼可见的提升。比如一双鞋的生成图,皮革的反光、鞋底的纹理、褶皱的走向和整体的立体感都比旧版本更扎实。日杂封面、科幻场景等复杂构图也能较好还原提示词中的风格元素。
但部分区域仍存在熟悉的“AI 涂抹感”——尤其是手部、面部连接处或复杂遮挡关系下,细节容易糊成一片。有网友用它尝试做定格动画,发现连续帧之间的角色一致性还不够稳定,需要后期手动修正。
草图生图功能虽然方向正确,但对用户草图的比例和透视要求较高。如果随手画得太随意,AI 可能误解空间关系,导致生成结果偏离预期。
总的来说,Images 2.5 并没有带来像早期 DALL·E 那样的视觉震撼,但它把 AI 图像工具真正推向了生产流程。不再是“看看能生成什么”,而是“我要这样改,请执行”。这种从创意探索到精准控制的转变,或许才是 AGI 时代多模态能力落地的第一步。
现在,X(原 Twitter)上已经有不少用户开始用新功能玩梗、做表情包甚至尝试商业项目。正如 OpenAI CEO 奥特曼所说:“AI 不用都去做数学题,玩就完事了。”但玩的背后,其实是工具可用性的实质性进步。