一位参加Kaggle基准测试挑战的选手,公布了本地与托管大模型评测第一天的结果。他发现一个反常识的现象:大多数模型面对无法回答的问题时,选择的是"糊弄",而不是"上报"。

更让他意外的是,评测框架本身的Bug,一开始被他当成了模型的行为表现。换句话说,他以为模型在犯傻,其实是自己的测试工具在捣乱。

打开网易新闻 查看精彩图片

模型为什么不"认输"

面对没有答案的问题,理想中的模型应该主动升级处理,把问题交出去。但第一天的评测显示,大多数模型并没有这么做,而是硬着头皮给出回应。

这种"糊弄"行为,在跑分场景里很容易被误读成能力问题。选手的观察指向另一层:模型的行为模式,和评测者预期的处理路径并不一致。

Bug和模型行为,第一天分不清

评测刚开始,框架层面的问题先冒了出来。这些Bug的表现形式,和模型输出异常几乎一模一样,导致选手最初把工具故障归到了模型头上。

对做基准测试的人来说,这是个提醒:跑分第一天看到的"模型行为",未必都来自模型本身。区分框架问题和模型问题,本身就是评测工作的一部分。