匿名模型Ox Alpha(牛来)此前在OpenRouter上线四天冲至全球第二,但独立开发者WesRoth公布的DeepSWE完整测试显示其准确率约63%,远低于此前10题子集测试的80%。
小样本跑分很容易制造性能神话,只有经过完整测试集的验证才能得到真实性能结果,这也说明当前AI评测体系仍需建立更严格、更全面的标准,避免被碎片化测试结果误导。
匿名模型Ox Alpha(牛来)此前在OpenRouter上线四天冲至全球第二,但独立开发者WesRoth公布的DeepSWE完整测试显示其准确率约63%,远低于此前10题子集测试的80%。
小样本跑分很容易制造性能神话,只有经过完整测试集的验证才能得到真实性能结果,这也说明当前AI评测体系仍需建立更严格、更全面的标准,避免被碎片化测试结果误导。
热门跟贴