一个语言模型面对完全陌生的交互式谜题,没有参考样本,却自发把任务转写成代数方程,然后一步步推算出反射公式。ARC Prize的研究人员说,这是他们第一次看到模型出现这样的行为。这也让Anthropic的Claude Opus 5在ARC-AGI-3基准上拿下了30.2%的得分,而此前由OpenAI GPT-5.6 Sol(Max)保持的最好成绩只有7.8%。
ARC Prize在最新
打开网易新闻 查看精彩图片
一个语言模型面对完全陌生的交互式谜题,没有参考样本,却自发把任务转写成代数方程,然后一步步推算出反射公式。ARC Prize的研究人员说,这是他们第一次看到模型出现这样的行为。这也让Anthropic的Claude Opus 5在ARC-AGI-3基准上拿下了30.2%的得分,而此前由OpenAI GPT-5.6 Sol(Max)保持的最好成绩只有7.8%。
ARC Prize在最新
热门跟贴