OpenAI 推出 ChatGPT Images 2.5:延迟减半,支持草图微调与局部编辑

1 阅读

延迟砍半,画质更细:Images 2.5 的核心升级

OpenAI 最近上线了 ChatGPT Images 2.5,这是继今年 4 月 Images 2 之后又一次实质性迭代。最直观的改进是速度——官方称图像生成延迟最多降低了 50%。对普通用户来说,这意味着从输入提示到看到结果的时间明显缩短,尤其在移动端或网络条件一般的情况下,体验流畅度提升显著。

1.png

除了快,图像本身的细节也更扎实。新模型在自然光照表现、材质纹理还原和边缘锐度上做了优化。比如生成一张室内场景,以前可能灯具反光略显生硬,现在能更真实地模拟光线在不同表面的反射;又比如织物褶皱、金属拉丝或木纹肌理,细节层次更丰富,少了那种“AI 特有的塑料感”。

这些改进并非单纯堆参数,而是结合了用户反馈和实际使用场景。OpenAI 没有公布具体架构变化,但从效果看,更像是在推理效率和生成质量之间找到了新的平衡点。

手绘草图变高清图:Sketch 功能怎么用?

Images 2.5 最让人眼前一亮的功能,是新增的 Sketch 草图输入。用户只需在聊天框里输入 “@Sketch”,就能调出一个简易绘图面板。你可以直接用手指或鼠标画个大概轮廓——比如一个歪歪扭扭的房子、一个人物侧影,甚至只是几个几何图形组合——然后配上文字描述,比如“现代风格别墅,带玻璃幕墙和泳池”。

模型会基于这个粗糙草图和文字提示,生成一张完整、精细的图像。草图在这里不是装饰,而是作为构图约束:房子的位置、人物朝向、物体相对大小等关键布局信息会被保留,但所有细节由 AI 补全。这对非专业用户特别友好,不用纠结复杂的提示词语法,也能控制画面结构。

此外,系统还预置了几种常用模板,比如社交媒体封面、电商商品主图、活动海报等。选择模板后,生成的图像会自动适配尺寸和留白区域,省去了后期裁剪调整的麻烦。更贴心的是,分享图像时可以一键附带原始提示词,方便他人复现或二次创作。

精准局部修改:告别“重画整个图”的烦恼

过去用 AI 生成图像,如果只想改某个小地方——比如把衣服颜色从红变蓝,或者删掉背景里的杂物——往往得重新写提示词,甚至整张图重来一遍。不仅麻烦,还容易导致其他部分细节退化,比如人脸变形、光影不一致。

Images 2.5 引入了图片内评论标注功能,解决了这个问题。你可以在生成的图像上直接点击某个区域,添加批注,比如“把这个包换成棕色”或“移除右下角的垃圾桶”。模型只会处理你指定的部分,其余内容原封不动。更重要的是,经过多轮这样的局部编辑,图像整体质量依然稳定,不会越改越糊。

这种能力背后依赖的是更精细的图像理解与编辑对齐技术。模型不仅要识别你圈出的区域是什么(比如“这是一个手提包”),还要理解修改指令的语义(“换成棕色”意味着保留形状和材质,只变颜色),同时确保新内容与周围环境在光照、透视上协调。虽然偶尔还是会出错(比如误判物体边界),但相比之前已是巨大进步。

开发者注意:两款 API 模型定位不同

对于开发者,OpenAI 这次提供了两个 API 模型选项,分别针对不同需求:

  • GPT-Image-2.5Flare:主打速度和吞吐量,适合需要大量生成图像的场景,比如社交媒体内容、用户头像、快速原型设计、视觉搜索结果预览等。它的生成时间短,成本相对较低,适合对绝对精度要求不那么苛刻的应用。

  • GPT-Image-2.5Sunburst:侧重编辑控制和成品质量,适用于营销素材、产品精修图、高保真视觉资产等场景。它支持更复杂的局部修改指令,图像一致性更强,但生成耗时更长,调用成本也更高。

两个模型都支持多种分辨率输出,单边最长不超过 3840 像素,总像素数范围在 655,360 到 8,294,400 之间。这意味着最高可输出接近 4K(3840×2160)的图像,满足大多数商业用途。开发者可以根据业务场景灵活选择,不必为简单任务支付高端模型的费用。

安全与溯源:水印和元数据成标配

在 AI 图像滥用风险日益增加的背景下,Images 2.5 延续并强化了 OpenAI 的安全策略。所有生成的图像都会自动嵌入两层标识:

一是 C2PA(Content Authenticity Initiative)元数据,这是一种行业标准的内容凭证格式,记录了图像的生成工具、时间、提示词摘要等信息。主流平台如 Adobe、微软等已支持读取 C2PA 数据,有助于判断内容来源。

二是 隐形水印,肉眼不可见,但可通过特定算法检测。即使图像被裁剪、压缩或加滤镜,水印仍能保留一定鲁棒性,用于追踪是否由 OpenAI 工具生成。

这两项措施主要目的是打击未授权复用和深度伪造。比如有人用 AI 生成名人假照用于诈骗,平台可通过水印快速识别来源并下架。当然,用户也可以选择关闭部分标识(视具体产品策略而定),但默认开启已成为行业趋势。

实际体验:快了,也更好用了

从实际测试来看,Images 2.5 的确让图像生成变得更“日常”。延迟降低后,反复尝试不同提示词的成本变低,用户更愿意探索创意。Sketch 功能虽然简单,但对非设计师群体很实用——画个火柴人加上“赛博朋克风格”,真能出一张有氛围感的角色图。

局部编辑功能目前还在灰度测试阶段,但已展现出潜力。比如生成一张产品图后,只需圈出 logo 区域说“换成我们的品牌”,就能快速定制,无需重新建模渲染。这对中小商家做营销素材尤其有价值。

不过也要看到局限:草图识别对复杂构图仍不够稳定,有时会忽略用户手绘的细节;局部修改在涉及光影联动的场景(比如改光源位置)时,仍可能出现不协调。但这些问题属于“可用但需优化”的范畴,而非根本缺陷。

总的来说,Images 2.5 不是一次炫技式的跃进,而是围绕真实工作流做的务实改进。它没喊“颠覆设计行业”的口号,但确实让 AI 图像工具离“好用、可靠、高效”又近了一步。