把推理档位调到最高,成绩反而掉了。这不是段子,是ARC-AGI-1上跑出来的结果。
在ARC-AGI-1上,high推理档位拿到88.5%,而low档位是90.5%。两者相差2个百分点,方向却是反的——档位更高,分数更低。
打开网易新闻 查看精彩图片
这2分是怎么丢的
分数差异集中在8个任务上。high档位在其中5个任务上表现更差,合计少了4.5分;在另外3个任务上表现更好,合计多了2.5分。一进一出,正好对应那2个百分点的下滑。
成本上的反差同样明显。high档位多用了35%的输出token,但这些多出来的token并没有换来更稳定的正确答案。换句话说,多花的算力没有兑现成更好的结果。
ARC-AGI-2上的账更绕
到了ARC-AGI-2,max推理档位报告的单任务成本看起来比high还低:0.129美元对0.133美元。但这个平均值是把记录到的成本除以全部120个任务算出来的,其中包含未完成的任务。
实际情况是,max档位有13个任务因API问题未完成,high档位有8个未完成。如果只比较两者都完成的106个任务,max档位实际上每个任务贵了4.5%。
完整结果:arcprize.org/results/deepse…
这组数据抛出的问题很直接:推理档位和答案质量之间,并不是一条单调上升的曲线。多给模型思考的预算,它可能想得更多,但不一定想得更对。对使用者来说,档位选择更像是一次需要实测的权衡,而不是"拉满就完事"。
热门跟贴