henry 发自 凹非寺
量子位 | 公众号 QbitAI

来来来,说多模态路边一条,不是AGI的都来排队道歉(doge)。

在喊出“AGI时代来了”之后,你奥特曼叔叔搬出来的第一个东西,就是多模态!

刚刚,OpenAI发布新一代生图模型,ChatGPT Images 2.5,主打生成更快,细节更好,改图也终于越来越像“真·修图”了。

打开网易新闻 查看精彩图片

按照OpenAI的说法,这次升级可以先划四个重点:

  • 生图更快,相比Images 2.0,生成延迟最多降低50%;
  • 画面更自然,参考照片里的人和物更容易保住原本的特征;
  • 连续修改多轮,前面改好的细节更容易保持一致;
  • 支持直接在图片上添加批注,告诉AI具体要改哪里。

除此之外,这次还有一个我觉得相当实用的新玩法——

直接拿草图当参考图。

这个东西非常适合一种情况:

脑子里大概知道自己想要什么构图,但一时半会儿又找不到合适的参考图。

现在可以直接在对话框里@Sketch,自己画。

打开网易新闻 查看精彩图片

只要用鼠标(或者随便什么)画一张草图,再补充你想要的风格和细节,GPT就会把它作为视觉参考,生成完整图片。

非常好用(就离谱)。

打开网易新闻 查看精彩图片

一如既往,对于懒人,OpenAI也准备了一套新的模板,直接套就完事了。

打开网易新闻 查看精彩图片

By the way,现在GPT终于支持看百分比的生成进度了,不用再问“在吗”看网断没断了!

打开网易新闻 查看精彩图片

重点补的是细节和“别乱动”

如果说上面这些是功能层面的变化,那么从这次技术博客来看,相比4个半月前发布的GPT Image 2,Images 2.5真正值得看的升级,还是生成质量和编辑稳定性本身

Images 2.5并没有单纯继续往上堆输出分辨率,最高依然是3840px,但新增了xhigh和max质量档位,进一步提升细节、材质纹理、光照,以及参考主体的保真度。

比如官方这张Demo。

打开网易新闻 查看精彩图片

给小孩哥换了一身衣服之后,脸部基本没怎么漂,尤其是原图里卷发那种稍微有点毛躁的质感,保留得相当完整。

但你要硬说,这张给小狗换的还是有点没那么……完美。

打开网易新闻 查看精彩图片

主体确实改对了,但仔细看影子,后背轮廓似乎还是保留了原来的形状。

按理说,穿上衣服后,影子的后背也应该变平滑。

但像下面这种,把原始照片重新还原、放大,同时重新处理打光,效果还是挺惊艳的。

打开网易新闻 查看精彩图片

而相比单纯“把图画得更漂亮”,Images 2.5这次更重要的一个方向就是让修图改图变得更加可控。

官方展示了一组很典型的电商场景:不断给人物换衣服、换背景。

虽然有些图看起来还是稍微有点“AI塑料感”,但人物本身、场景关系和整体构图已经能比较稳定地保留下来。

(尤其可以看看Image 2和2.5在人物与物体比例上的变化。)

更进一步,ChatGPT现在还支持直接在图片上批注修改。

思路很像平时给设计稿提意见:

不用再写一大段“请把画面左上角第二个人脸上的墨镜换成黑框眼镜”,直接圈那个地方,写一句要求就行。

比如我在表情包生成界面里,直接在墨镜的位置批注“换成黑框眼镜”,点发送。

GPT就知道我说的是哪一个。

打开网易新闻 查看精彩图片

如果一张图里有很多人物、很多物体,这个功能尤其好用。

与此同时,模型本身的局部编辑能力也在增强。

官方有一组旅行票券的演示,很适合说明这个变化。

打开网易新闻 查看精彩图片

放到实际工作里,就很像做一整套不同城市的活动物料:

版式已经定了,需要替换的只是城市信息,但每做一版,你都希望继续沿用前面的设计。

这就牵出了Images 2.5另外一个重点——多轮编辑的一致性。

很多时候,对于设计工作者来说,一张图不可能一遍生成就结束。第一轮把主体生成出来,第二轮改排版,第三轮换文字,第四轮再抠一些细节。

以前经常改着改着就变成:这次这里终于对了,结果刚才已经对的地方又坏了。

OpenAI表示,在更长的对话中,Images 2.5可以更稳定地接着上一轮结果继续修改,同时保住已经确认好的内容和画质。

比如下面这种旅行攻略海报,文字、照片、路线、排版全挤在一张图里,修改时需要同时照顾的元素比单主体图片多得多。

现在可以先换目的地,再继续改单独的文字和细节。

打开网易新闻 查看精彩图片

不多说,这完全是设计福音来的,懂得都懂~

生图才是正经事儿

当然,除了编辑之外,Images 2.5对复杂画面、材质和风格指令的理解也一起升级了。

官方放了一大堆Demo。比如碎玻璃:

打开网易新闻 查看精彩图片

日杂封面:

打开网易新闻 查看精彩图片

还有《银翼杀手》式的科幻画面:

打开网易新闻 查看精彩图片

其他的咱就不多放了……

当然了,生图这玩意,本质上还是创造力工具。就像奥特曼说的,它又不是拿来做数学题的。

玩就完事了。

打开网易新闻 查看精彩图片

我自己也上手试了一下。

输入就一张马喽的照片,让它给我生成一组“马喽在世界各地旅游打卡”的照片。

GPT直接给我整了4张。

打开网易新闻 查看精彩图片

效果怎么说呢——这个马喽是真出息了。

网友们也是直接开玩。

打开网易新闻 查看精彩图片

有哥们直接拿它做起了定格动画。

打开网易新闻 查看精彩图片

还有人感叹细节已经离谱了。

打开网易新闻 查看精彩图片

不过我自己看下来,部分区域还是能感觉到一点熟悉的AI“涂抹感”。

也有人测试了手绘草图。

大方向确实能跟,但一些比例关系还是会出问题。

打开网易新闻 查看精彩图片

但材质和体积感的提升还是很明显。

比如下面这双鞋,皮革、鞋底、褶皱和立体感,相比以前确实更扎实了。

打开网易新闻 查看精彩图片

当然,也已经有网友给出不同反馈:

细节确实好了不少,但人物肢体反而偶尔更容易翻车。

所以到底是史诗级升级,还是熟悉的“这边补好了,那边又冒出新Bug”,大家实测下来也可以说说。

生成延迟最多减半,API一次上了两个版本

最后再说速度和价格。

对于一天要生几十上百张图的人来说,这次一个很实际的变化是:

Images 2.5生成延迟相比Images 2.0最多降低50%。

听着没有“画质炸裂”那么性感,但真到了反复改图的时候,少等一半其实相当重要。

尤其Images 2.5明显开始强调多轮编辑。

既然要你第一轮改内容、第二轮改版式、第三轮继续抠细节,那生成速度自然也得跟上。

面向开发者,OpenAI这次还同时发布了两个API模型。

一个是GPT-Image-2.5 Flare

它更强调质量、编辑能力和速度之间的平衡,也是官方推荐的大多数应用默认使用的版本,适合社交内容、快速视觉原型和大批量生图等场景。

打开网易新闻 查看精彩图片

另一个是GPT-Image-2.5 Sunburst。

它瞄准的是更精细的创作和编辑需求,比如正式投放的广告素材、产品图片,以及对画质要求更高的视觉内容。

打开网易新闻 查看精彩图片

价格方面,Flare和Sunburst目前采用相同的token计费:

  • 文本输入:5美元 / 百万tokens
  • 图像输入:8美元 / 百万tokens
  • 图像输出:30美元 / 百万tokens

打开网易新闻 查看精彩图片

所以整体看下来,Images 2.5这次跟2那种直接生成老照片质感的视觉冲击还差点意思?

(也可能是还没开发出来)

但它确实把生成模型开始真正进入生产流程之后,那些不多轮交互、定点修改的问题进一步清扫了一遍。

换句话说,过去大家用生图模型,多少还有点“抽卡”,现在直接定点p就完事了。

现在,x上的网友也已经玩疯了!

所以就说嘛,AI也不用都去做数学题。

打开网易新闻 查看精彩图片

[1]https://openai.com/index/introducing-chatgpt-images-2-5/
[2]https://x.com/sama/status/2097410967978324010