腾讯一篇论文发现,把多模态模型切到非思考模式,虽然能降低延迟,却会明显抬高用户能看到的响应失败概率。这个结论来自新基准PatternEval,它用2415个提示词做测试,专门看答案形态,而不是只看答案对不对。

四个维度盯住“答得怪”

打开网易新闻 查看精彩图片

PatternEval从四个角度评估:思维链泄露、重复、逻辑矛盾,还有表演性推理。这些问题是正确性检查抓不到的,但用户一眼就能感觉到不对劲。

为什么正确性检查不够用

传统评估只看最终答案是否正确,忽略了模型在“思考过程”里暴露的毛病。PatternEval补上的正是这块空白——答案可能对,但推理过程已经翻车。