金磊 发自 凹非寺
量子位 | 公众号 QbitAI

家人们,你们看下面这两张图,能分得出哪张是AI,哪张是真实的吗?

打开网易新闻 查看精彩图片

答案是,都是AI

即便我们把图片放大,似乎也是找不到以前那种“一眼AI”的细节:

打开网易新闻 查看精彩图片

而且啊,这两张图片并非出自你以为的Image 2.5之手,实则是来自一个国产AI——

正是我们之前称之为“今年WAIC最惊艳的图”背后的模型,来自商汤科技SenseNova U1 Pro(下文简称U1 Pro)。

而这次是正式版上线,现在已经可以在商汤小浣熊平台上使用,API也已经开始向企业客户开放了。

不过有一说一,图生成的好只是一方面;生成后能不能继续改、直到达到可商用,同样也是现在AI生图圈里比较关注的一点。

因此,接下来,我们就要对U1 Pro来一波深度实测了~

生完图还能继续精修

在实测之前,老规矩,我们先来介绍一下操作方式。

首先是小浣熊这个平台,点击输入框下方的“一图读懂”,就可以选择U1 Pro模型了:

打开网易新闻 查看精彩图片

不过目前小浣熊平台仅支持复杂图片的生成,企业客户可以通过API或者SenseNova Studio体验多轮修改等功能。

所以我们特意申请了实测邀请码,接下来的实测也将在SenseNova Studio平台上展开,同样是选择U1 Pro模型即可(2K清晰度起步,最高4K):

打开网易新闻 查看精彩图片

给生活照换个风格

第一轮实测,我们小试牛刀一下,拿一张随手拍的生活照,把它重构成完全不同的风格。

首先我们上传一张自己拍的照片:

打开网易新闻 查看精彩图片

△此图为实拍图

并附上这样的Prompt:

打开网易新闻 查看精彩图片

仅仅几分钟时间,写实的人物照片就切换好风格了:

打开网易新闻 查看精彩图片

可以看到,U1 Pro很好地理解到了Prompt的意图,并在没有发生任何畸变的情况下,将整体图片变成了纸质的感觉。

但到这里还没有完,我们继续给U1 Pro上难度,让它在新图的基础上,只对局部进行调整:

只修改人物深色外套里面的黑色圆领T恤,将T恤改为白色。 修改范围严格限定在敞开外套之间、颈部下方至腰部上方可见的内搭T恤纸片,包括圆领边缘。

打开网易新闻 查看精彩图片

这张图局部改色的难点在于,T恤是黑色的、皮带是黑色的、裤子也是黑色的,加上人物胸前还有胸牌遮挡,AI极容易混淆边界。

但U1 Pro却精准地把T恤的边界给拿捏住了;由此可见,它对于图片整体的把控还是相当到位的。

多图合成一家猫咪经营的微缩咖啡店

刚才的实测我们只是输入了一张图,那如果是多个参考图,U1 Pro是否也能hold住呢?

来,上四张图:

打开网易新闻 查看精彩图片

这次实测的效果,我们想要把这四张图片揉成一张一家猫咪经营的微缩咖啡店。Prompt如下:

将四张参考图组合成一张横版4:3的微缩咖啡店宣传海报,主题是虚构店铺“街角补给站”。请明确区分四张图的作用。
图1:只参考店面的建筑轮廓、门窗数量、门窗相对位置和遮阳棚形状,把它制作成摆在桌面上的1:12微缩店铺模型。原图招牌文字统一替换为“街角补给站”,不要改成另一种建筑。
图2:参考这只猫的毛色、额头花纹、脸部轮廓和胸口特征,制作成店铺里的微缩猫店长。让猫坐在门口一张小凳子上,系一条深蓝色围裙,身体比例自然,不做成人类身体。
图3:参考杯子的形状、把手、颜色和表面图案,把它缩小后放在店外的小桌上。杯子与桌椅符合微缩场景的相对比例,不修改产品结构,不额外增加杯子。
图4:只参考海报的版面分区和文字层级,不复制其中的物品、配色或示例文字。 店铺使用涂漆木材、透明亚克力窗、织物遮阳棚和细小金属门把手,呈现真实手工模型的质感。所有主体采用一致的透视与左上方柔和光线,有合理接触阴影,不能像四张图片直接拼贴。
海报必须完整、准确地出现以下文字:店名“街角补给站”;主标题“今天,先喝一杯再出发”;产品信息“桂花拿铁 28元”;营业信息“营业时间 08:00—20:00”。 店名可以出现在实体招牌上,其余信息放在海报文字区。不要编造地址、联系方式、促销信息或二维码。整体温暖、有生活感,信息在手机正常阅读尺寸下清楚可辨。

打开网易新闻 查看精彩图片

猫还是那只猫,杯子还是那个杯子,店铺门面也没有改变,并且最终生成的图片也跟结构草图完全对应上了。

由此可见,U1 Pro不仅能一口气抓取每张参考图的关键信息,同样是不发生任何畸变的情况下,把它们按照Prompt要求完整输出出来。

修改,修改,再修改!

在第一轮实测中,虽然我们已经感受到了U1 Pro修改局部内容的能力,但在真实工作环境中,修改这件事,可能还真不是只发生一次。

所以接下来,我们就测试一下,当连续修改时,U1 Pro是否依旧能够稳定发挥。

先来改一下刚才“猫咪咖啡店海报”的价格

编辑这张海报,只把“桂花拿铁 28元”改为“桂花拿铁 26元”。
保持产品名称、原有字体风格、字号、文字颜色和所在位置,尽量只改价格中的必要字符。
店铺、猫咪、杯子、招牌、主标题、营业时间、背景、光影和其他文字保持原样,不重新设计整张海报。

打开网易新闻 查看精彩图片

可以看到,原先的“28元”,已经改成了“26元”,并且是毫无违和感的那种。

继续修改

把主标题“今天,先喝一杯再出发”替换为“今天的好心情,从这一杯开始”。
新标题仍放在原主标题区域,可以在这个区域内合理换行并小幅调整字号,保持原来的字体风格、颜色和视觉层级。
不要遮挡店铺、猫咪、杯子或其他信息。

打开网易新闻 查看精彩图片

再继续:

只把桌上咖啡杯的杯身底色改为深墨绿色。保留杯子原来的形状、把手结构、表面图案、大小、位置、材质和光照关系。

打开网易新闻 查看精彩图片

连续三轮的修改,图片全程都是指哪儿改哪儿,其它地方可以明显看到一点都没有发生任何变化。

由此可见,U1 Pro确实是经得起连续折腾的那种生图AI了。

一口气生成八格连续动作

第四轮实测,我们再上难度。

之前Image 2.5刚出的时候,就有不少网友整个了活儿,就是让基于一张原图,生成一个八宫格、连续动作的图片;再基于生成出来的图片,做成一个可以动的GIF。

那么我们也来看下U1 Pro能否做到,输入图是这样的一只猫咪:

打开网易新闻 查看精彩图片

Prompt如下:

根据上传的猫咪参考图,生成一张横版16:9的连续动作图集,严格分成4列×2行,共8格。每格都是同样尺寸的正方形,格间使用等宽窄白边,方便后续裁切,不添加格号或任何文字。
主角是一只以参考照片中的猫为原型的手工毛毡猫,保留它的额头花纹、脸部轮廓、胸口毛色和尾巴纹路,佩戴一条深蓝色小围巾。画面具有真实毛毡纤维和定格动画布景的质感。
八格按从左到右、从上到下的顺序,连续表现同一只猫在办公桌前结束工作的过程:
第1格,猫坐在凳子上,两只前爪放在打开的笔记本电脑前;
第2格,猫抬起右前爪,伸向电脑屏幕上沿;
第3格,右前爪把屏幕压到半合状态;
第4格,屏幕完全合上,前爪仍搭在电脑上;
第5格,猫收回前爪,身体转向画面右侧;
第6格,猫从凳子上跳下,身体处于低空,朝右移动;
第7格,猫落在地面,向右迈步;
第8格,猫走到画面右边缘,身体仍完整可见,办公桌与合上的电脑留在身后。
镜头固定为能同时看见桌面和地面的正侧面中远景。背景是简单的米白墙和木地板,只有一张桌子、一张凳子和一台无品牌标识的电脑。每格的镜头、桌椅位置、物体尺寸、光线与背景保持一致,电脑从第4格起一直保持合上。
所有格子只有同一只猫,不增加角色,不更换围巾或花纹。每格推进一个明确动作,不要生成八张彼此无关的姿势图。

打开网易新闻 查看精彩图片

从结果来看,即使是8张连续的图,输入的猫咪依旧是稳稳保持住了原型;然后生成的最终图片,也是按照Prompt要求,生成了连续的动作。

最后把这张图变成GIF,效果就出来了:

打开网易新闻 查看精彩图片

这样的宫格图片,其实在AI视频生成场景中是比较实用的,我们可以用类似的方式,让同一个人物生成连续的动作,再由AI视频生成的工具基于此去稳稳地生成一段视频。

例如这样的:

打开网易新闻 查看精彩图片

做一张复杂的科普图

最后的实测,我们来做一张复杂的科普图

不过这一次,我们不会给U1 Pro任何输入图,也不会给它任何资料素材。

仅仅通过一段Prompt,让它自行去搜集资料

为面向普通读者的科普账号制作一张竖版3:4中文海报,标题为“月亮为什么会变脸?” 请先实际查阅NASA的Moon Phases与Moon Facts等官方资料,核实以下问题:月光从哪里来;常见月相变化如何形成;月相变化与月食有什么区别。
将核实后的内容组织成一張完整海报。视觉采用“纸上月亮博物馆”:用八枚糖霜饼干式圆形月亮表现一个月相循环,表面为哑光、轻微颗粒感和浅浮雕质感,亮面与暗面要清楚区分。暗面仍保留完整圆形轮廓,避免把月相误画成月球缺了一块。
八个月相严格依次排列并标注:“新月”“蛾眉月”“上弦月”“盈凸月”“满月”“亏凸月”“下弦月”“残月”。采用北半球常见月相示意的亮面方向,所有月亮的表示方式保持一致,并在图中注明这一示意约定。
图中必须准确表达:月光主要是反射的太阳光;月相变化来自我们看到的月球受光部分发生变化;普通月相变化不是地球影子遮住月亮。
将解释压缩为适合手机阅读的三条短句,不塞入整段百科文字。用奶油白、炭灰和少量淡金色形成安静、有收藏感的科普视觉,文字与月相名称清晰,不增加未经核实的数字或日期。
完成后检查月相名称、顺序、亮面方向和解释文字是否一致,再输出海报。请在图片之外提供实际参考的官方页面标题与链接;不要编造来源,也不要把检索过程塞进画面。如果当前入口无法检索,请明确说明,不能假装已经查阅。

打开网易新闻 查看精彩图片

可以看到,U1 Pro自己先从网络上搜集到了更多与之相关的材料,而后将资料与我们Prompt相匹配,并进行整合;最终给出了一张信息量丰富的科普图。

能交付的生图AI,才算过关

最后,我们回头再来看一下刚才实测中的一个细节——那杯从28元改到26元的拿铁。

类似这样的修改,其实在现实工作、创作场景中是非常常见的,而且往往不可能只修改一次。

所以刚才我们连续三次对图片做了修改,并且能够保持图片其它细节没有发生任何畸变,其中的意义和价值就不言而喻了。

毕竟AI生图这块,此前最被大家诟病的一个点,便是牵一发而动全身。

但U1 Pro却能经得住多轮、连续的修改和折腾,说明它已经是一个具备可交付性的那种生图AI了。

顺着这个思路,我们又给它派了个品牌电商从业者会碰到的活儿:拿现成的咖啡杯白底图,做一张能放进商品详情页的生活场景图。

桌面、背景和光线都可以重新安排,但杯型、把手和杯身图案得跟原商品对得上,毕竟消费者看完图片,下单买的就是这只杯子。

打开网易新闻 查看精彩图片

以及简单2句话,就能生成可直接商用的复杂信息海报,信息还是U1 Pro自己检索的那种:

请围绕“第83届威尼斯国际电影节”自主检索并制作一张竖版3:4中文新闻信息海报。所有事实、日期、文案和视觉编排均由你根据检索结果完成。

打开网易新闻 查看精彩图片

当然,可交付性不能只局限在广告海报这一类商业场景,对于创作者来说,人物的细节、画面的质感、元素的丰富度,也都属于可交付性的范畴。

由此我们也就能够理解商汤为什么要给U1 Pro安排一套更完整的创作流程:

需求理解、信息搜索与补全、素材处理、生成编辑,以及检查修正,都被纳入同一套创作管线,围绕最终用途推进。用户交过去的任务,可以从一组零散素材开始,做到一份有明确使用目的的成果。

总而言之,现在的生图AI已经不缺“啊哈时刻”了,缺的是能继续不出错地改、直到可以最终交付的那种AI。

而U1 Pro,绝对是符合这一标准的生图AI之一。

One More Thing

刚才我们的实测更倾向于展现U1 Pro的功能,但其实它在艺术的表现力上,也是够打的。

来,欣赏一下U1 Pro的Gallery(左右滑动查看更多图片):

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

SenseNova U1 Pro小浣熊体验地址:
https://office.xiaohuanxiong.com/