ChatGPT Images 2.5 来了,这次终于敢接着改了

举报
Lucifer三思而后行 发表于 2026/09/09 13:33:09 2026/09/09
【摘要】 OpenAI 在 2026 年 9 月 8 日正式发布了 ChatGPT Images 2.5,并直接把它称为新的 state-of-the-art image model。我今天早上扫了一遍官方介绍,第一眼看到的是速度快了、细节更好了、光影更自然了。这些当然不错,但说实话,现在的图片模型再跟我讲「画质提升」,已经很难让我特别兴奋。现在的模型,第一次出图通常都不差。真正把人折腾够呛的,是后面...

OpenAI 在 2026 年 9 月 8 日正式发布了 ChatGPT Images 2.5,并直接把它称为新的 state-of-the-art image model。

OpenAI 在 X 上发布 ChatGPT Images 2.5

我今天早上扫了一遍官方介绍,第一眼看到的是速度快了、细节更好了、光影更自然了。这些当然不错,但说实话,现在的图片模型再跟我讲「画质提升」,已经很难让我特别兴奋。

现在的模型,第一次出图通常都不差。真正把人折腾够呛的,是后面那几轮修改。

衣服颜色改对了,脸变了。人物保住了,背景里的字又乱了。好不容易把构图调顺,下一轮让它删个杯子,整个画面风格又漂了。最后你盯着那张已经改了半个小时的图,心里只有一句话:算了,重新来吧。

所以这次 Images 2.5 最让我感兴趣的,不是它能不能第一张就把人惊到,而是 OpenAI 反复强调的一件事:模型开始更清楚什么该改,什么不该碰了。

这听起来没那么炸裂,却可能比「更高清」实用得多。

改着改着,人别没了

根据 OpenAI 的介绍,Images 2.5 相比 Images 2.0,生成延迟最高降低 50%,参考图中的人物和主体更容易保留下来,光照与纹理也更自然。

这里的「最高 50%」先别急着理解成每张图都快一倍。图片尺寸、任务复杂度、排队情况都会影响实际速度,我也还没有把常用场景完整跑一遍。但方向很明确:以前等一张图的时间,现在有机会多试一个版本。

更关键的是参考图一致性。

大家用 AI 做头像、宠物照、产品图或者文章封面,应该都碰到过这种事。你明明给了一张参考图,第一轮还挺像,改着改着人就不是那个人了,宠物的花纹和神态也可能跟着跑。五官、服装、发型,甚至年龄都会悄悄变化。模型不是不会画,而是每一轮都像在重新猜一次。

Images 2.5 要解决的,就是这种「越改越不像」的问题。OpenAI 展示的案例里,孩子的姿势、脸部特征和蓝色背景都被保留下来,只换了服装。单看结果未必有多震撼,但做过连续改图的人应该知道,难的恰恰是后面这半句。

修改前的参考照片

更换服装后的结果

以前我们夸一个生图模型,常说它「画得真好」。现在更值得问的是,这张图还能不能接着改。

这次官方专门讲了精确编辑和多轮编辑一致性。

精确编辑很好理解。你让它换掉一件商品、一个背景或者一处文案,模型尽量只动这一块,周围的人物、构图和品牌风格继续留着。多轮一致性则是前面已经确认过的修改,后面别又偷偷改回去,图也别随着轮次增加越来越糊。

我觉得这才是图片模型从「玩具」往生产工具走的关键一步。

做一张真正要用的图,很少是一条 Prompt 定生死。通常都是先出个大方向,再一点点磨,人物往左挪一点,背景别这么满,衣服换个颜色,标题区域留出来,最后再处理一两个碍眼的小东西。

以前每次修改都像重新开盲盒。你只想动 10%,却要拿剩下 90% 去冒险。运气不好,一处好了,三处坏了。

如果 Images 2.5 真能把这个问题压下去,省掉的不只是几分钟等待,而是大量「上一版明明已经挺好了」的无效返工。这个提升没有一张惊艳的样片那么好传播,但天天做图的人大概率更在意它。

有些想法,画出来比说半天好使

除了模型本身,ChatGPT 里还增加了几个很实际的入口。

一个是 Sketch。手机端输入 @Sketch,可以先用手指画一个很粗糙的构图,再告诉 ChatGPT 想要什么风格。你不用费劲描述「人物位于画面左下三分之一,右侧保留负空间」,直接画两笔,很多时候反而说得更明白。

还有图片评论。打开图片后,直接在需要修改的位置留下要求,不必再跟模型解释「右边靠近窗户下面那个小东西」。这个设计挺朴素,但我很喜欢。图片本来就是空间信息,非要全部翻译成文字,多少有点为难人。

模板也来了,海报、商品图这些常用类型不用每次从空白 Prompt 起步。做内容的人应该会省不少事,特别是临时要一张活动图、封面或者配图的时候。碰到一个好用的 Prompt,现在还可以连着图片一起分享出去,别人换上自己的照片和要求就能继续玩,不用再对着成品倒推提示词。

不过别把这些理解成 Prompt 从此没用了。草图能告诉模型东西放在哪儿,却不能替你决定这张图到底想表达什么。模板能把基本结构搭起来,也救不了一个没想清楚的主题。

工具把「怎么说」变简单了,但「要说什么」还是得自己来。

Flare 快,Sunburst 慢一点但更细

开发者这边,OpenAI 一次放出了两个模型。

GPT-Image-2.5 Flare 是默认推荐,主打速度、质量和大批量使用。官方称它比 GPT-Image-2 延迟低 50%,更适合社交内容、商品体验、视觉搜索、快速原型以及高频生成。

GPT-Image-2.5 Sunburst 则更偏精细控制,适合正式广告、产品精修这类对细节要求更高的工作,代价是生成时间更长。

这两个名字听着有点像显卡的不同档位,但产品思路挺清楚。不是所有图都值得开最高配置。批量跑草稿和社媒素材,用 Flare;最后那张真的要投放、还要反复精修的,再考虑 Sunburst。

另外,Images 2.5 已经面向 ChatGPT、ChatGPT Work 和 Codex 的各档用户,在桌面、网页和移动端陆续开放。API 也已经提供这两个模型。如果你的界面里还没看到 Sketch 或模板,不一定是账号有问题,部分功能仍在分平台逐步上线,Work 模式暂时也没有模板。

OpenAI 说,现在每周通过 ChatGPT Images 和 API 里的 GPT-Image 模型生成的图片已经超过 30 亿张。

这个量挺吓人。

模型越会保留人物特征、光影越自然、修改越不露痕迹,好用是真的好用,伪造也会更像真的。OpenAI 这次继续给生成图加入 C2PA 元数据和不可见水印,并在提示词与图片两端做安全检查。

这些措施有必要,但也别把水印想成万能验钞机。图片被截图、转存、压缩或者二次编辑以后,来源信息未必永远完整。以后看到一张「太像真的」的图片,查来源、找上下文、看发布账号,恐怕会变成更普通的动作。

技术把造图门槛继续往下压,辨别图片的成本却不会自动跟着下降。这个账,后面还有得算。

先别急着喊封神

我还没来得及把 Images 2.5 的常用场景全测一遍,所以暂时不准备喊「封神」。发布页上的案例是一回事,中文排版、连续改封面、复杂截图重绘、人物一致性到底能撑多少轮,还得自己跑了才知道。

但从这次更新的重点看,OpenAI 显然不满足于让大家偶尔抽一张漂亮图。Sketch、局部评论、模板、精确编辑、多轮一致性,这些功能拼在一起,指向的是一套能反复沟通、持续修改的工作流。

这也是我对 Images 2.5 最大的期待。

我不缺一张第一眼很惊艳、第二轮就不敢再碰的图。我更想要的是,人物已经对了就别换脸,构图确认了就别乱跑,让我指哪儿改哪儿,哪怕多聊五轮,前面的活也别白干。

如果它真能做到这一点,图片模型才算慢慢从「帮我画一张」,走到了「陪我把这张图改完」。

参考资料

  1. OpenAI,Introducing ChatGPT Images 2.5
  2. OpenAI,ChatGPT Release Notes
  3. OpenAI,ChatGPT Images 2.5 Safety Evaluations
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。