给研究型AI智能体下达指令时,告诉它"用什么方法",几乎等于什么都没说。真正决定表现的是操作步骤本身——这是新基准测试ASI-Bench给出的核心发现。
60个真实研究项目,只改指令措辞
打开网易新闻 查看精彩图片
ASI-Bench为智能体准备了60个真实研究项目,覆盖11个科学领域。每次测试的目标、数据、评分标准完全一致,唯一变化的是指令内容:完整步骤、仅方法名、或者只有目标和数据。
测试覆盖18种智能体与模型组合。结果显示,拿到完整步骤的智能体平均得分50.91;只给方法名时,平均分骤降至29.10。连方法名也不提供,分数再掉2.5分。也就是说,几乎全部性能损失都来自步骤的缺失。
方法名反而更烧钱
一个反直觉的发现是:只给方法名的指令,运行成本反而最高。它比完整指令多消耗59%的token,甚至比完全不提方法的指令还要贵。
打开网易新闻 查看精彩图片
原因不难理解:点名一个方法,相当于把智能体钉在一个方向上,但所有实现细节仍需它自己从头重建。步骤缺失带来的摸索成本,最终体现在了token消耗上。
对AI智能体开发意味着什么
这项基准测试指向一个实用结论:与其告诉智能体"用某某算法",不如把操作流程一步步写清楚。方法名是方向,步骤才是路线图。对于依赖智能体执行复杂研究任务的团队来说,指令编写的颗粒度,可能比模型选型更直接影响产出质量。
ASI-Bench的测试设计也值得注意——它用同一批项目、同一套评分标准,只改变指令措辞,从而把"指令质量"这个变量单独剥离出来。这种控制变量的思路,为评估和优化智能体指令提供了可复用的框架。
热门跟贴