SemiAnalysis 在 ExploitGym 上对 GLM-5.3 的网络能力做了一轮评估,并分析了它的执行轨迹。结果里有一个细节值得注意:这个模型把大部分执行预算,用在了测试隐藏的运行时条件是否改变了它的结论上。
换句话说,它不是在急着给出答案,而是在反复确认答案成不成立。评估方把这种行为放进了执行轨迹里观察,而不是只看最终结果。
打开网易新闻 查看精彩图片
一个具体样本:arvo5665
在问题 arvo5665 中,GLM-5.3 通过 sanitizer 构建、语料测试和目标 fuzzing,探索了更多周边程序。这三项动作指向的是同一个方向——把问题周围的环境摸清楚,而不是只盯着问题本身。
评估方在结论里提到,GLM-5.3 将大部分执行预算用于测试隐藏的运行时条件是否改变了其结论。这个描述对应的是执行过程中的资源分配,而不是能力评分。
相关评估内容发布在 Anthropic 的研究页面上,标题指向 GLM-5.3 与高级网络能力的扩散。
热门跟贴