给图像模型写提示词,这件事更像是在调用一个没有模式定义、没有类型检查、而且无法保证相同输入返回相同结果的 API。你输入一串文字,它返回一张图。这图有没有对上你的要求,全靠一轮无声的拉扯。我决定把这轮拉扯量化,就在两个平台之间做了一个小规模的受控测试。一个是 OpenArt,通用型创意套件;另一个是 PixAI,专攻动漫生成,除此之外几乎不做别的。
测试用的角色是原创的。你需要把她当做一个必须按字段填写的固定需求来看。角色名字叫 Rin,头发是深靛蓝色,左侧有一缕青蓝色的挑染发丝,眼睛是暖琥珀色。上身穿着宽大的奶油色针织连帽衫,里面搭一件白色有领衬衫。背景要纯色摄影棚风格,整体画风是干净的赛璐珞风动画。这么写出来,有两个字段是最挑刺的。头发那缕挑染是故意设计成细碎的需求,因为在一头深色底色上拉出一缕亮色,正是模型一旦不在仔细读提示词时最先抹掉的细节。纯色背景则是一个伪装起来的反向约束,它在叫模型什么都不要加。
两边平台都跑在免费方案上。在那家动漫专精的平台,我还特意把它设在最低画质档。如果拿一家的免费档去跟另一家的付费档比,这对比还没开始就已经废了。每个平台跑两次。第一次直接用原始设定。第二次把头发挑染的描述加得更硬、更直白,理论前提是第一次如果翻车,那可能是提示词写得不够狠,而不是模型不行。样本量很小,我也只当一次小样本观察来写。重点在于失败模式,而不是当成基准跑分来看。
先跑通用型平台。这个平台本身工程上很有分量。一个账户覆盖了一大排模型的图像生成、视频、可导航的三维场景、音频、一个靠对话驱动的镜头序列工具,还有自训练模型和完整编辑套件。把它想象成一个把全部工具都内包进来的单体仓库,表面铺得很宽,但只维护一个依赖。光是左侧导航栏就排着导演、视频、图像、世界、角色和音频。这就是它主打的全能承诺,全挤在一列里。想在里面找到动漫风格,还得往下翻一阵。只有单独一个检查点是为这种风格搭的,周围全是面向摄影、肖像和产品拍摄的调校模型。风格输出上面倒是过了关,两轮都返回干净的赛璐珞动画风,没有滑向半写实,而那恰恰是通用模型在试图画动画时最容易垮的地方。字段层面的匹配全掉了。发型经常变成单色,挑染消失,眼睛颜色不对,背景被人悄悄加了百叶窗或者窗台,而且一件毛茸茸的奶油色连帽衫被画成羊毛衫再搭一件背心。加硬约束的那一轮反而更有意思。把描述写得更强硬之后,模型输出的不是更准确,而是换了个方向出错,就像把问题从缺失直接推成另一种不准确。这看起来不像是一个请求没写清楚的问题,倒更像是模型把审美上的好看排在字面需求的前面。一个冰激凌甜筒凭空出现在画面里,而这个道具在任何一版提示词里都没提过。
再跑动漫专精平台。风格匹配上没什么悬念,到了这个领域它就是主场。第一轮跑下来,头发颜色准确。靛蓝基底上挂着那缕青蓝色的挑染。上衣也是正确的样式和质感,宽松的奶油色连帽衫材质表现得很对。眼睛颜色也对,袖口面料也抓准了。唯一没一次性到位的是纯色背景,模型给画面后方加了大片花枝,也就是把那个反向约束当成建议来处理。第二轮把挑染描述强化之后,所有字段全部通过。头发准确,靛蓝色基底下左侧有一缕青蓝色。连帽衫样式正确,奶油色材质到位。眼睛是暖琥珀色,这是我从这个模型里看到层次最细腻的瞳色呈现。背景纯色无杂物,没有多余的道具,没有意外的花卉。两轮在角色面容上也保持了高度一致,看起来就是同一个人。而通用型平台两轮跑出来的脸型差异,大到像属于两个完全不同的角色。
两边的差距落在同一个地方。信息保留。动漫专精模型在基础模式与加强提示词下,都把原始设定里的字面需求咬得更紧。这不是创意表现力的事,而是需求回收率。一个普通创作者在反复改动提示词的时候,真正想解决的也不是让图变好看,而是让它对上脑子里已经画好的那张图。而这个角色规范本身就是一个创意版本的系统提示词,它要求的是确定的字段而非灵感。
为什么一个专精模型能把字段级的需求锁住,而一个强大的通用模型反而会漂移,这个问题也许可以往训练数据构成上想一想。专精模型长时间只吃动漫材料,概念空间更窄,同一个发型术语对应的图像变化更少,模型学会的是严格抄写,而不是发挥。通用模型横跨摄影、三维渲染、产品白底图、电影剧照,看过的毛衣和头发的组合过于丰富,反而更倾向于输出一类统计意义上的毛衣或者一类统计意义上好看的发型,而不是用户打字那几行里具体的描述。那个凭空出现的冰激凌,可能是提示词里某种甜蜜感被模型联想出来,而不是什么随机错误。
结论也落在同一个词上。可重复性。两个平台跑了同一份角色规范,通用模型像在对话里猜你的意思,专精模型更多时候在直接逐条执行。如果创作流程里需要的是同一张脸、同一件衣服、同一缕挑染,能稳定复现的那一边就更像是成熟工具该有的样子。这个观察只基于两次短跑,不是什么正式测评,但也许能帮你在选工具时把关注点从参数量和风格多样性,拉到另一个更基础的问题上。当你第二次输入完全相同的需求时,它能不能给你同一个角色。
热门跟贴