模型发布后每隔几周,同一个帖子就会冒出来:"是我错觉,还是Claude今天变笨了?"Claude Opus 5.5在9月22日上线,这一次,有开发者在抱怨出现之前就开始测量了。livenerf把一组固定的难题每天跑一次,连续跑30天,工具链锁定版本,日志公开,目的是让下一次"Claude被削弱"的争论能拿发布周的基线数据来说话。如果你在用Claude Code或者API搭东西,这套方法值得抄给自家agent用。

先看几个关键数字

打开网易新闻 查看精彩图片

livenerf在Opus 5.5发布后2.5天启动,每天测一次,持续30天。到9月29日已经完成6天,没有一天漏测。

测试面板是78道题,从2336道筛选题里挑出来的——标准是Opus 5.5有时做对、有时做错。总是做对的题,测不出下滑;总是做错的题,同样测不出。

这套装置能检测出每10天窗口约7.5个准确率点的下滑。第一次可能得出结论的时间,大约在10月24日前后。

在一次刻意设计的验证里,把"effort"调低,输出token减少了26%到62%,但准确率只掉了4到8个点。token数量,是最早的预警信号。

Anthropic自己在2025年的复盘文章里的表态是:"我们从不因为需求、时段或服务器负载而降低模型质量。"

为什么这件事一直没法证明

"Nerf"是游戏圈的词,指补丁把某个东西改弱了。用在语言模型上,指的是厂商在发布后某几天或几周,悄悄用同一个名字提供更差的模型。

livenerf的README列了常见的怀疑对象:量化、同名背后换小模型、降低effort、路由变化。它也列了最无聊的那种可能:"也可能什么都没发生,人们只是在噪声里找规律。"

问题一直出在缺少起点。用README的话说:"没有人有一个干净的day-0基线可以对照,所以每次争论最后都变成感觉对感觉。"你对模型发布当天有多好的记忆,是这屋里最不可靠的仪器。你当时很兴奋,你的prompt不一样,你只记得那些成功的例子。

关于这个仓库的Hacker News讨论帖有786分、300多条评论,两边阵营都在。一条评论写道:"在绝大多数被报告的情况里,模型被'削弱'这件事并不存在。"另一条说:"人们只是在适应新的智能水平。"还有一位Claude Code用户解释说,他现在每次都关掉应用内的反馈弹窗,因为"质量更稳定了",然后他补了一句——这点值得肯定——"完全是临时和个人的经验。"这就是livenerf想取代的证据现状。

它是怎么测的

这套设计是一串决定,每一个都堵掉一种测量可能撒谎的方式。

面板要能动。作者从GPQA Diamond、MMLU-Pro、竞赛数学和AIME 2025–26里筛了2336道题,每道采样四次。Opus 5.5第一次就做对约93%,97%的题要么总是对、要么总是错。总是做对的题显示不出下滑,总是做错的也不能。那78道有时对有时错的题成了面板,因为更弱的模型会最先在这里露馅。

不用AI当裁判。评分是精确匹配,"永远不用LLM裁判,因为裁判自己也会漂移。"如果评分的是另一个模型,裁判被削弱看起来就像被测对象变了。

封闭调用。系统提示词冻结,不用工具,不接MCP服务器,不读CLAUDE.md。

锁定测试框架。它跑在Claude Max订阅上,通过无头Claude Code(claude -p)执行,CLI锁定在2.1.280版本。README对原因说得很直白:"锁定CLI。这不是可选项:一次Claude Code更新就改变了测试框架,而改变了的框架看起来和改变了的模型一模一样。"

用订阅而不是API。PLAN.md估算,完整每日跑一次的API版本大约每天55美元,一个月约1600美元。订阅路线测的,也正是大多数抱怨者实际在用的东西。

设对照组。更老的claude-opus-5每天也回答同样的GPQA题目。"如果两个模型一起动,那是框架或平台变了。"如果只有Opus 5.5动,变化就在模型本身。

预先写好的判定规则。只有在99%区间连续两个10天窗口都排除零、下滑至少3个点、且对照组没有同步移动时,才会判定为"nerf"。在数据到来之前就把规则写下来,是作者在第20天看起来激动人心时保持诚实的方式。

工具链建立在英国AI安全研究所的Inspect之上,统计方法遵循Evan Miller的《Adding Error Bars to Evals》,由Anthropic发表。也就是说,Anthropic自己的统计论文,成了审计Anthropic模型的方法。

这套基准能看到什么,看不到什么

在信任一个探测器之前,要先故意弄坏点东西,看它能不能发现。作者用Claude的effort设置做了这件事,结果写在VALIDATION.md里:

每个样本的输出token中位数,从high effort的638降到medium的474、low的293。README的总结是:"降低effort在token上比在准确率上明显得多。"把思考砍掉近三分之二,分数只掉了8个点,勉强高于检测阈值。

盲区也写在前面。"换成Opus 5,在99%水平上和Opus 5.5无法区分"——测得的差距是−3.8 ± 6.3个点,token少了23%。最可能的那种悄悄降级,也就是同家族换成上一代模型,恰恰是这套装置目前叫不出来的。一个基准肯把自己的局限印在首页,值得尊重。

审计还发现了基准本身的问题:78道面板题里,8道答案键看起来是错的,30道有歧义。它们被标记后保留,好让面板保持恒定。这个nerf探测器在找到"nerf"之前,先在测试集里找到了bug。

还有一个服务细节:"安全分类器有时会用Opus 5来回答,或者拒绝生物学和部分数学问题。"这些样本会从评分里剔除。