模型评测基准不少,但能覆盖推理、编程、数学等多个类别,还按周期发布更新的,LiveBench算一个。它的定位很直接:一套动态的、覆盖面广的基准,任务取自真实场景。

它到底评什么

打开网易新闻 查看精彩图片

从名字能看出,LiveBench面向的是真实世界任务,而不是单一维度的能力测试。推理、编程、数学这些类别都被纳入同一套评测框架,覆盖面是它的核心卖点之一。

更关键的是"动态"两个字。它不是一次性发布就固定不变的题库,而是通过周期性发布来更新内容。

评分怎么保证公平

LiveBench的另一处设计在于评分环节。它采用标准化的评判协议来给模型打分,让不同模型、不同批次之间的结果具备可比性。

这套组合拳解决的是评测领域的老问题:题目一旦公开就会被针对性训练,基准很快失效。周期性更新,等于让基准保持"新鲜"。

对关注模型能力对比的人来说,LiveBench提供的是一个持续滚动、多类别覆盖的观察窗口。