OpenAI首席执行官山姆·奥特曼。图像经由人工智能处理
文丨晓静
编辑丨徐青阳
OpenAI在美国时间九月八日宣布推出生图领域的新作品——ChatGPT Images 2.5。
此次升级聚焦于三个方面:编辑精准度、参考图还原度、连续修改的稳定性。当用户对图像进行多次调整时,之前的修改成果得到更好的保护。针对人物、商品或场景等元素的单独修改,现在可做到只动指定区域。与前代相比,新版本的处理速度提升了最多五成。
功能层面,新增了Sketch绘图、模板库和评论标注三大实用工具。用户可直接在平台勾勒草稿供模型参考,也能在图像上直观标注改动需求。调用API的开发人员获得了两个选择方案:Flare及Sunburst。
根据OpenAI的数据,用户群体每个星期经由生图工具生成的图像数量突破三十亿张。该功能现已向ChatGPT、工作版和Codex等产品线推出,跨越网页、计算机客户端和手机应用等多个平台。

01 精准定点修改
生成完毕后的修改,才是AI制图最考验功力的环节。想象这样的场景:人物满足要求却需换装,商品敲定但背景不合,海报基本成型只需修改文字。而在先前的版本里,做出任何改动时,整张图都可能被迫跟着调整。
这一次,精准编辑成为了升级重点。官方案例中能见到「整身修改」和「跨城旅程票卡」两个应用场景。演示通过一组连续对比图,验证模型是否真的懂得按指令改动特定内容,与此同时维护整体构图、主体要素和背景细节。

以跨城旅程票为例,假如只需更新其中某条信息,模型必须精准定位改动项,并确保票券的整体格局完整无损。相比凭空生成精美图像,这类能力对商品展示、广告创意和企业视觉识别更有实战价值。
多次迭代编辑是另一大突破点。立方体变向、行程信息表、寿辰烛火三个范例贯穿始终:非一步到位,而是逐轮递进式调整。OpenAI想表达的核心诉求是:往前的改动保持生效,往后的修改不会反复摧毁已成之事。

而这,也是本轮升级中最叫人眼亮的地方。
推特用户@thesoragirls就此进行了一项直观测试:绘入蜡烛并标记其中花瓣为「不动区」,观察模型触碰其余部分时是否会越界。测试数据回传的结论:被锁定的花瓣毫发无伤,其他位置却按需而变。

然而,阶段式修改并未从根本消除细节隐忧。日本动画师@genel_ai的实测暴露了一个事实:尽管官方宣称多轮后仍能守住画面品质,但改动层层递进时,锯齿感和纹理漂移仍会暗中作祟。

简言之,2.5的稳定度确有长进,但面对复杂构图时,清晰度衰减依然难免。
02 参考素材,保真更强
对参考图片的处理方式,构成了2.5升级的第二大亮点。
用户现可导入人物、萌宠或其他核心主体的照片,令其跨越到崭新场景、切换美学风格或重塑画面架构。官方承诺新版更善于锁定人脸识别数据,同步改进光影层次和表面质感。
为此官方同时投放五组实例:婴儿肖像再设计、狗儿穿衣秀、投币亭式证件照、多人聚会合成、卧室收纳调整。

这套范例的覆盖面很广。婴儿照和证件照重在考察个体特征的传承;狗狗穿衣侧重于主体更衣后的原型守护;聚会合照牵涉多角色同框共存;床铺整理贴近日常创作,考的是对实景的针对性微调。

这项能力对于需持续调用统一人物、商品或品牌视觉的工作至关紧要。调API的使用者能围绕同一参考图衍生多个变版本,大幅削减每次重头生成时的面目改变。
复杂场景的驾驭力也是本轮案例的聚焦点。OpenAI呈现了一幅50年代审美的家庭画:众人伫立于巨型圆筒形太空居所前,内部点缀翠色园林、湖水映照、未来建筑群。

官网展示的宜昌游历版面将目地信息、景区资料、视觉素材和文案集为一体,集成成旅游指南。其难点在于并行处理多幅图像、分层文本和板式逻辑,绝非单项达优即可通过。

另一系列九方格海报汇聚中古现代风格,单张承载各异几何纹样与字句——Create、Grow together、Choose kindness。
一幅旧金山街景以印象派笔触呈现:街衢自彩房交织处斜落,远景映入湾景及金门桥影。

更有奶油金Como婚邀、倒悬城市、美国国家公园复古八邮、日耀科普页、蓝金地球镶嵌、ChatGPT贴画、雨夜城景等多类创作。

其涵盖插画、海报、请帖、信息图、教科类图、商品宣传诸般类型。OpenAI的着眼点同样清晰:指令同时约束架构、文本、美学和细部要素时,2.5能更周全地指令落实。
时尚创业家Yana Welinder验证后表态,2.5在设计领域的表现有感知提升。她坦言旧版虽能锁定参考设计,最后输出却时常显得平面;而2.5则令原设计得以更丰富层次的视觉展开。

然不乏异议之声。AI与软件工程师Mark Kretschmann针对林地景象专项噪音及伪迹校验。

其判断为2.5虽见改良,但测试表现欠稳。进一步将2.5与2.0对标后,他指出所测多数范例中,2.0的逼真度竟更胜一筹。
据此而论,2.5的聚焦面为编辑掌控与复杂指令执行,却在不同图像品类的实践效果上仍存差异。
03 几笔勾勒,AI来完成
模型升级之外,OpenAI还为ChatGPT添配了若干新颖的交互方式。
首当其冲是Sketch绘图功能。用户可在平台上直接勾勒草稿,供模型据此生成终稿。房间设计时先交付平面概图;服装打样先勾勒轮廓;甚至仓促间画的粗框架也能丢给ChatGPT补全。后续只需补充美感诉求与细项参数。
调用法则是「@Sketch」指令。这一设计实际削减了对文本Prompt的倚赖。某些布局靠措辞难以表达清晰,尤其当涉及物件位置、缩放比和基形轮廓时。现下用户可以画为先,余下交由模型延续。
推特用户@fquolodasha试用后,对2.5的手绘理解力赞不绝口,直呼效果「着实了得」,并为OpenAI近段迭新频率与能力跃升感到惊叹。

模板库则应对另一痛点。ChatGPT新纳入若干通用创意架构如海报、周边品。用户择模后填入诉求信息、视觉构件与审美取向,甭须每回都面对空白版面从零起笔。
分享图像时也可同步交付原生成Prompt。他人获取后,换入个人素材与参数再行生成皆可。
官方范例为80年代复古人像:烫卷、彩衣、金饰、霓虹、播放器。用户可借此逻辑,替换自己的面容重新产图。

04 API双子版本上线
API生态同步适配2.5。官方推出Flare及Sunburst两款方案。
Flare设为基础方案,聚焦速率、品质、编辑权能。官方数据:质量优胜前代,时延砍半,适用于社交素材、商品展示、视觉搜索、快速试验、批量生成等场景。
Sunburst为精业方案,瞄准精细调度需求如正式广告、高端产品摄影。允许延长处理周期以换得更高编辑精准度。
初期用户反响资料中,编辑操控力是共鸣重点。
Highsfield AI产品负责人Axultan Alimkulov着重指出,Flare善于甄别哪些素材应锁定不动。对影视、自制内容及广告队伍而言,这代表修改单一元素时能最大幅度保守原角色、排版与品牌视觉。
连续创业人@gkxspace将此轮更新置于商用制图工作流下审视。他的观点是AI生图长期掣肘之一,乃首张可心仪却难以其为基点稳定迭代二、三版。2.5在迭代修改、生速与参考图保真的进阶,为电商变装、品牌物料展开、连续插画诸应用场景开拓了实用价值。

现阶段,覆盖范围已拓展至ChatGPT、企业版和代码平台全用户,API的双版本方案同步上线。OpenAI并行部署了指令校验、图像安防、C2PA标签及隐形数码印记等多层机制,以便溯源工具生成之作品。
据官示范与现有测试情景论证,本轮升级的主攻面清晰可辨:让生成后修改触手可及,让参考素材在循环使用中久驻不摇,并补全Sketch绘图、模板库、标注批注等工作流环节。
至于逼真度、精度以及迭代后的清晰保持,现阶段测评已呈分野。2.5能否切实改善这些瓶颈到何种地步,有待用户实战长期验证。
特约翻译金鹿亦参与本稿完成