指令式图像编辑看起来是一项定向操作:你把一张图交给模型,输入“把杯子换成花束”,就能得到换好的图。这种体验很容易让人形成一种心智模型——编辑就像是在某个区域打一个补丁。但过去一周,我用同一个模型对同一张源图反复进行了9次运行,其中8次为指令编辑、1次为掩码对照,结果证明这个心智模型是错的,而错误的代价会出现在你根本没留意的细节里。 我专门生成了一张动漫自行车快递员图像作为测试对象。图中人物带有大量小而可数的细节:薄荷绿底切短发、石板蓝夹克配一条橙色胸条、一只手戴无指手套、三枚珐琅别针、另一只手腕系着红色头巾、手边还有一杯咖啡,旁边立着一块写有“OPEN”的粉笔板。之所以刻意塞满这些细节,是因为它们都可以被量化对比,任何一个微小的意外改动都能立刻暴露出来。 所有编辑都在PixAI平台上使用其最新的Tsubaki.3模型完成。这里有个环境细节需要注意:源图像放入“Base Image”槽位后,该槽位只接受一个文件,一旦加载,宽高比控制项就会消失,输出会自动继承输入画面的长宽比例。我收到的8张指令编辑结果,分辨率与源图完全一致,这让前后对比变得非常直观。另外,平台自带的“prompt helper”会重写或翻译用户指令,为了确保结果可归因于我的原始措辞,我把它关闭了。 干净的成果集中在两个层面:属性和物体。 第一次测试是把头发从薄荷绿改成海军蓝。结果发色变了,但发型、剃掉的侧边、夹克、脸部全部保持原样,几乎无可挑剔。第二次测试是把手中的咖啡杯换成纸包花束。模型不仅完成了替换,还保留了原本的握持姿势和手腕位置——考虑到手和物体在画面上通常是交织在一起的,这个细节尤其值得注意。 结构性的请求则彻底失败。我曾三次要求模型改变肢体位置:其中两次是想让那只戴手套的手离开车把,但模型始终没有做出正确的动作。所有涉及关节、姿态、肢体空间关系的指令,结果都不可用。 这组对照清晰说明了一个问题:基于指令的图像编辑并不是在“修补”某个区域,而是模型基于文本提示对整张图像进行一次重新推理和生成。在属性替换和物体替换这类“换什么”的任务上,模型表现良好;但一旦涉及“移动到哪”这类“怎么动”的任务,它就会暴露出对空间关系和物理结构的理解不足。 对使用者来说,这提醒我们:不要因为局部编辑成功就认为模型掌握了图像结构。编辑完成后,务必检查那些你没有刻意关注的细节——它们往往才是模型犯错的重灾区。

打开网易新闻 查看精彩图片