一个基准测试的跑分成本,19个月里跌了99.95%。ARC Prize 公布的数据显示,在 ARC-AGI-1 上达到 75% 分数,成本从 o3-preview 的每任务 26 美元,降到了 DeepSeek V4 Flash 的每任务 0.01 美元。

这不是某一次降价,是一条持续下坠的曲线。19 个月,从二十多美元到一美分,中间没有反弹。

打开网易新闻 查看精彩图片

更快的版本:6个月跌99.44%

ARC-AGI-2 上的曲线更陡。同样达到 75% 分数,成本从 Gemini 3 Deep Think 的每任务 13.62 美元,降到 Dots3-Note Preview 的每任务 0.08 美元,只用了 6 个月。

两个基准,两条曲线,方向一致:能跑出高分的模型越来越多,跑一次的价格越来越低。

便宜下来的到底是什么

把成本拆开看,变化来自两端。一端是模型本身,同样的任务用更少的算力就能完成;另一端是推理价格,单位 token 的报价在往下走。

26 美元到 0.01 美元,差的不只是钱。它意味着一个原本只有预算充足的研究团队才跑得起的测试,现在可以随手跑上几千次。

ARC Prize 这条数据发布后,浏览量停在 13.1K。数字不大,但曲线本身够说明问题:跑分这件事,正在从奢侈品变成日用品。