OpenAI宣布”AGI时代”后的第一个大招,是个修图软件:ChatGPT Images 2.5把生图从抽卡变成了定点P图
OpenAI宣布”AGI时代”后的第一个大招,是个修图软件:ChatGPT Images 2.5把生图从抽卡变成了定点P图
9月4日,OpenAI说AGI时代到了。五天后,他们端出来的第一个新东西,不是更强的推理模型,不是更安全的Agent框架——是一个生图模型。ChatGPT Images 2.5,主打”画得更快、细节更好、修图终于像修图了”。
这其实挺有意思的。一个号称实现了AGI的公司,AGI时代的第一个多模态产品,是个Photoshop平替。Sam Altman自己都说:生图嘛,又不是拿来做数学题的。
但别急着笑。仔细看这次更新,我反而觉得这是OpenAI在”AGI宣言”之后最务实的动作。
四个重点,每个都打在痛点
按照OpenAI自己的说法,Images 2.5这次升级划了四个重点:
第一,生成延迟降低最多50%。听着不性感,但做设计的都懂。你调了五次参数终于看到一张能用的图,还得继续改——这时候每少等一半时间,就能多出两倍迭代次数。
第二,画面更自然,保真度更高。不是简单堆分辨率(最高依然是3840px),而是加了新的”细节增强”模块,专门提升材质纹理、光照效果和参考主体的特征保留。官方演示里给小孩哥换衣服,卷发的毛躁质感保留得相当完整。
第三,多轮编辑一致性。这是2.5真正的重点。以前改图经常”这里终于对了,但刚才对的地方又坏了”。2.5改进了对话中的编辑稳定性——第一轮改内容、第二轮改版式、第三轮继续抠细节,每轮结果的一致性明显提升。
第四——也是我觉得最实用的一点——支持直接在图片上加批注。不用写长篇大论的”请把画面左上角第二个人脸上的墨镜换成黑框眼镜”,直接在图片上圈那个位置,写一句要求就行。
再加一个隐藏彩蛋:现在GPT终于支持看生成进度的百分比了。不用再问”在吗”来确认网断了没有。
@Sketch:你画画这么丑,AI也能救
新功能里最有意思的是@Sketch。
脑子里有构图但画不出来的场景,现在可以直接在对话框里@Sketch,然后用鼠标画一张草稿(真的就是”画得像幼儿园水平”那种),GPT就会把它作为视觉参考,结合文字描述生成完整图片。
这东西本质上做了一件事:把生图模型的输入门槛从”你得像摄影师一样描述场景”降到了”你得像三岁小孩一样随手画几笔”。
专业设计师可能觉得这没啥用——他们本来就会用参考图。但对于大量的非设计岗位(产品经理、运营、创业者),这个功能意味着第一次可以用”画+说”的方式而不是”纯写提示词”的方式跟AI沟通视觉创意。
两个版本,各取所需
这次API一次上了两个模型。
GPT-Image-2.5 Flare:最常用版,强调质量、速度和编辑能力的平衡。适合社交内容、快速原型和大批量生图。 GPT-Image-2.5 Sunburst:高质量版,瞄准正式投放的广告素材和产品图片,对画质要求更高的场景。
价格相同:文本输入$5/百万tokens,图像输入$8/百万tokens,图像输出$30/百万tokens。
对比一下——Midjourney的月费是$10-$120,但API是按调用计费的。Flare和Sunburst的计费逻辑跟GPT语言模型一致,token计价。如果一张图占总图像输出的”十几万到几十万tokens”,单张成本可能在几美分到几毛钱之间。对于大批量生成来说,这个价格结构相比Midjourney的固定月费制更具弹性优势。
别吹”AGI第一个生图模型”了,看看真正的方向
量子位的文章标题叫”AGI时代的第一个生图模型”——有道理,OpenAI确实刚喊完AGI就发了这个。
但这个定位有问题。
如果你看了Images 2.5的完整更新,会发现OpenAI这次做的不是”更聪明的画图AI”,而是“更可控的生产力工具”。延迟减半、批注修改、多轮一致性——全是冲着”把这个模型塞进别人的工作流”去的,而不是”生成一张让你哇一声的图”。
和2.0那种直接生成老照片的视觉冲击相比,2.5确实没那么”性感”。但它把生图模型从”抽卡”模式变成了”定点P图”模式。
这背后其实跟OpenAI最近的产品战略完全一致:AGI不只是更聪明的模型,更是能真正嵌入工作流的工具。
Brockman说过的那句话可以放在这里做注脚:AGI的定义是”在大多数具有经济价值的工作上表现优于人类”。生图这件事,过去最大的问题不是”画得不够好”,而是”不能按我的意思改”。
Images 2.5解决的就是这个。所以它也许不是最性感的AGI产品,但可能是最实用的那个。