大模型评测正在换玩法。ByteDance Seed 等机构发布了一项名为 HarnessDev 的新基准,核心变化是把评估单位从“任务输出”转向“可运行的 harness”。

两阶段评估机制

打开网易新闻 查看精彩图片

这套基准分为 Creation 与 Evolution 两个阶段。前者考察模型从零构建 harness 的能力,后者则检验其能否在已有基础上迭代演化。打分维度覆盖能力表现与执行 token 成本,兼顾效果与效率。

为什么值得关注

传统评测只看最终答案对不对,HarnessDev 则要求模型交付一套能跑通的完整工具链。这意味着评估重心从“答对题”前移到“搭好台子”,对模型的工程化能力提出了更高要求。