我花了一个下午调试一个看似“提示工程”的问题,最后发现它其实是“输入验证”的问题。 PixAI在8月初发布了Studio——一种节点画布,图像、视频、文本和音频都可以作为同一张图上的资产,通过边连接。在图像生成视频的工作流中,图片是输入,文本指令则描述运动。我在图库里有一张已完成的主视觉插图,想让它生成5秒的动态片段。于是,我以同一张源图为基础,用了三条不同的指令进行测试。结果出乎我的意料。 第一次,我故意写了一个预期会失败的“贪婪指令”。六项请求塞进四句话:角色转动身体面向镜头,用右臂推开船体,伸手伸向观众,碎片从她身边掠过;同时相机绕着她旋转并推进;还有闪光、火花、快速戏剧性动作。角色旋转、身体推力、手臂伸展、两重相机运动、环境粒子、光影变化——这些全是视频生成中容易出问题的元素。可笑的是,它全执行了。面部保持住了,角色的标志性细节也都在。 第二次,我按照常规的提示工程思路,收窄了范围:一个主要动作,明确的不可变项,一个相机运动。指令变成了:“角色原地缓慢漂移,头转向镜头,最终面向观众。她飘动的头发和橙色电缆随之轻轻晃动。相机缓慢而稳定地推进。她的面部、右眼上的镜头、衣领环和右手装甲手套全程保持不变。” 从提示工程的角度看,这条指令更简短、更明确,质量更高。但输出却只有几度的头部旋转,辅助元素确实动了,而相机几乎没动,或者说动得很诡异。良好的约束在这里没有带来更好的结果。 第三次,我调整了策略,去掉了所有“不变量”和“保持”字眼,只保留动作描述,结果动作完整性又回来了。这就很奇怪:明明第一次的贪婪指令包含了更多动作,却能成功;第二次的严谨指令反而失败。问题显然不在提示词的结构和用词,而在于系统对输入文本的预处理——它会把包含“保持不变”“全程不变”等验证性短语的子句直接剥离或忽略。换句话说,这是一个典型的输入验证漏洞:系统定义了输入格式,却用简单模式匹配去判断哪些部分有效,导致语法上“否定性约束”被错误地当作无效输入丢弃。 这个发现让我重新思考:在AI工具中,用户花大量精力优化提示词,但实际上系统的输入验证可能已经悄悄剪掉了最关键的部分。提示工程只能优化系统预期的表达方式,而输入验证则决定了哪些表达能够进入系统。如果验证规则不透明,再好的提示词也可能是白费。 这次实验给我一个教训:当模型的表现与你的指令质量严重不匹配时,不要急着调整措辞,先检查系统对输入做了哪些预处理。说不定,你的提示词并没有问题,只是被输入验证拦在了门外。

打开网易新闻 查看精彩图片