本文来自微信公众号: 显影笔记 ,作者:MengZhi
在生成式人工智能时代,Benchmark基准测试正在被越来越广泛的群体拆解、讨论。围绕Benchamrk分数的公开与对比,和伴随的争论,在技术历史中不是偶然,无论是数据库、Web技术,还是芯片硬件。
在这篇文章,我想讨论这个长期以来的现象,以及争议将走向何方?
01
Benchmark测量了什么,分数被怎么用?
公布Benchmark分数、与竞品进行分数对比,已经成为每一次模型新版发布时的「标准动作」。回归本源,Benchmark基准测试本身并不是为了发版而存在,它首先是技术产品研发中必要的工程手段。
以AI领域为例,Benchmark旨在评估模型在特定任务的泛化能力,承载了复杂评估范式要求,在预训练阶段、后训练阶段、生产发布前的验证阶段都是重要的评估来源之一。
而到了模型发布的技术传播环节,对外公开的Benchmark测评和分数,某种程度上起到了能力的“翻译”和“背书”,也为新闻报道、公开讨论提供了“事实”。特别是在激烈的竞争环境中,成为了进入讨论场的“入场券”、模型公司留在牌桌的证明。
但是当模型实力在拉近,分数以月为单位被刷新,围绕Benchmark和分数的质疑也随之而来。
02
每一次分数讨论背后,必然会指向的问题
AI竞赛的加速,使Benchmark逐渐成为一种“消耗品”。斯坦福2026年《AI Index报告》卷首语称,当模型之间能力趋同,用于评估他们的工具却难以保证有效,基准测试正趋于饱和,前沿模型披露的信息越来越少,独立测试结果也并不总能印证开发者所报告的情况。
因此催生出一个常被议论问题——新版分数提升、甚至超过竞品,为什么体验不到预期中的大幅度变化?
此外,围绕公开的Benchmark所做的针对性优化等诸多问题,也让分数的信任效力下降。OpenAI在其建立的软件工程能力基准测试SWE-bench Verified上观察到,模型性能提升放缓,过去6个月内准确率仅从74.9%提升到80.9%,宣布将停止报告该基准测试的分数。
这一幕在技术历史中并不陌生,让人不免联想到JavaScript引擎的测试历史——2017年,Chrome浏览器宣布了其一手打造的基准测试套件Octane的退休。相对于Octane出道5年即退休的历史,Open AI对于SWE-bench Verified的使用甚至只有2年。
市场对于Benchmark分数的另一重质疑,则来自于现实场景的复杂性。
尽管Bencharmk数量在激增,从语言理解、数学推理、代码生成,到多模态识别、安全对齐,乃至垂直行业的专项能力。但是每项Benchmark都有自己的局限,无论是数据、测试方式、还是评估与反馈方式层面等,测试结果不等同于现实环境中的能力表现,不一定完美匹配用例。于是引来了使用者群体另一个叠加问题——分数好、排名高,与自己有什么关联?
在我看来,这些讨论本质来自对技术能力的预期,对于应用场景适配的探索,对于分数公信力的思考。在多项技术的历史中,重复上演,也是技术走向成熟、竞争进入白热化的必然。
03
围绕Benchmark分数的自我解构与重塑
Benchmark的分数、特别是排名高低,天生就是“记忆符号”、适合引用的“新闻事实”。分数提供事实、吸引注意力,但「注意力」能留存多久、沉淀成什么样的认知,往往来自于现实。
Anthropic对于今年Sonnet 5发布,在新闻宣传材料中,不再将Sonnet与其它模型进行对比,只是与自家模型和历史版本进行对比,我将其理解为一种有意识的叙事管理——合理,但是讨论并不会因此终止。
Open AI的科学家则从“技术正在如何被应用”的角度,提出倡议。
今年6月,Open AI专注于推理研究的Noam Brown公开表示,现在的Benchmark缺乏对于预算维度的考虑,“当比较GPT-5.5和GPT-5.4在最大算力下的表现时,你得到的是近乎持平的结果。但当把两者对Token消耗量作图时,GPT-5.5在每一个固定预算下都明显更强”。他提出的主张是——Benchmark(基准测试)应当增加一条明确的X轴-Token、金钱、延迟,把模型性能绘制为算力预算的函数。
与之呼应的一个现象,来自Benchmark方法研究一端。在今年机器学习顶会ICML的Position-立场类型论文中,围绕评估和基准的论文达到了20篇,超过1/4占比,成为仅次于安全与对齐的第三大主题。论文主题主要聚焦于基准的可信度、评估的实用价值、验证困境。
在围绕分数竞赛的争议之外,Benchmark还有另一条价值轨道——在模型厂商的研发、企业客户的部署验证环节,它有不可替代的价值。当一系列Benchamark分数从内部指标变成一场公开竞赛,呈现的仅仅是看似"受控"的能力对比,而非真实实力和技术探索的完整表达。
无论是软件、芯片硬件,每一次技术历史上围绕Benchmark讨论和争议,都不会因为开发者和使用群体对表达的放弃而终结,往往需要评测标准迭代、行业规则重建,甚至底层技术范式的迁移。争议的消散,也不是因为市场完整看懂了每一个Benchmark分数,是因为开发者、普通用户、手握重金的技术买家,最终认可了那些原本依赖分数才能“代理表达”的产品能力。
经历过多项技术周期,在构思这篇文章的时候,我回忆起了那些关于“指标与分数”的激烈讨论。我关注那些自我解构的主张、被沉淀下来的声音、被技术衔接住应用事实。
在公众号「显影笔记」,分享现象和叙事之下,那些尚待「显影」的逻辑。
引用观点与事实信源:
Artificial Intelligence Index Report,Message from the Co-chairs
Open AI,Why SWE-bench Verified no longer measures frontier coding capabilities
Noam Brown,Benchmarks are lying to your procurement team
Claude Sonnet 5,www.anthropic.com/news/claude-sonnet-5
Retiring Octane,v8.dev/blog/retiring-octane
封面图:The Horse in Motion,Eadweard Muybridge
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
本文来自虎嗅,原文链接:https://www.huxiu.com/article/4886084.html?f=wyxwapp
热门跟贴