用户在消息里写「为什么 DeepSeek 回答得不对」时,往往已经把三样东西混在一起:原始输入、期望结果、实际得到的文本。这三样混在一起后,很难判断到底是哪个条件导致偏差。可能需求确实写明了;可能需求只存在于用户心里;也可能输入本身就不支持唯一答案。 所以,与其立刻重新提问,不如先做一张「差距卡」。它不会解释模型内部的真实原因,也不承诺给出唯一正确答案。它只做一件事:把任务重新放在可验证的基础上——实际传入了什么、期望得到什么、实际得到了什么、以及哪一个差距值得先检查。 这一点很重要,因为下一步动作不取决于「回答很奇怪」这个整体印象,而取决于差距的类型。有时需要补充约束;有时需要修正数据;有时需要承认:验收标准还没定义清楚。还有一个值得保持开放的问题:如果条件本身允许几种合理理解,差距卡够用吗? 设想一个实际任务:你要求模型基于特定数据、按指定格式、在若干限制下给出答案。结果里有用的部分不少,但缺了一个你认为必须有的要点。第一反应是更严厉地重写提示词,或者再补一句说明。 但在重试之前,还有一层模糊没有解决:那个缺失的要点,是明确写在输入里的?是期望格式的一部分?还是直到你把回答和自己的上下文对照时,才冒出来的?如果不把这几个选项分开,新提示词可能同时改了好几处。就算回答变了,你也不知道为什么。 差距卡在这里给出第一个部分结论:它把对话从「评价回答好不好」变成「检查一个可验证的不一致」。不是「回答很差」,而是「在期望结果中被标记为必填的某一点,实际回答里没有」。这还不是最终诊断,但已经足够让下一次尝试变成一次有方向的检验,而不是又一轮盲猜。

打开网易新闻 查看精彩图片