在固定输出预算下,GLM-5.3比GLM-5.2更有可能给出可见答案。但这次更难的六项可验证任务基准显示,首答得分只是故事的开始:GLM-5.3为4/6,GLM-5.2为2/6。更关键的反差是,唯一通过隐藏测试套件的依赖优化器来自GLM-5.2,而两款模型都在极端数学任务上失败。 本次测试使用真实API调用,任务覆盖六类可客观验证的问题:极端数学、因果校准、约束推理、嵌套JSON、多阶段物理、可执行优化代码。正式运行前,通过 `GET https://cn.crazyrouter.com/v1/models` 确认了两位模型的精确ID,12次首次运行响应也都正确返回了所请求的模型身份。 在完成度方面,GLM-5.3总共完成了4项首次运行任务,用时334.1秒;GLM-5.2完成了2项,用时665.0秒。延迟数据仅作为运营证据保留,并不改变正确性评分。 真正让两者都“翻车”的是极端数学任务。该任务给出四张优惠券概率:1/2、1/4、1/8、1/8,要求精确计算两个容斥结果: - E[T] = 1339/105 ≈ 12.752380952 - P(T<=8) = 46179/131072 ≈ 0.352317810 两款模型都消耗了完整的9000 token推理预算,仍没有返回可见答案。将预算提高到20000 token后,GLM-5.3依然返回空响应,GLM-5.2则超过运行器420秒的读取超时。这一现象有明确的生产启示:单纯提高 `max_tokens` 并不能保证可交付答案,网关需要同时检查 finish reason、可见内容与超时状态,才能做出准确判断。 GLM-5.3也有明显更强的部分。在辛普森悖论任务中,它正确恢复了反转关系: - 小石子:A组 81/87 > B组 234/270 - 大石子:A组 192/263 > B组 55/80 - 粗合计:A组 273/350 < B组 289/350 - 50/50标准化率:A=0.8305,B=0.7771 不仅如此,GLM-5.3还区分了“标准化”与“因果识别”,指出真正识别因果效应需要随机化或充分调整、阳性假设、无未测量混杂,并考虑不确定性。 整体来看,这项真实API硬基准表明:首答得分领先并不等于全面领先。GLM-5.3在多数任务上更快给出答案,却在极端数学题型上无解;GLM-5.2虽然首答成功率更低,却能产出唯一通过隐藏测试套件的优化代码。真正可靠的大模型评估,必须结合任务难度、可验证输出和失败模式综合判断。
热门跟贴