智能体(AI Agent)的能力到底该怎么衡量?中国信通院正在尝试回答这个问题。

据36氪消息,中国信通院正式启动“方升”智能体基准测试任务征集工作,面向社会公开征集高质量测试任务,以完善测试任务、测试环境和评价方法。

打开网易新闻 查看精彩图片

“方升”测什么?

打开网易新闻 查看精彩图片

这套基准测试并非单一维度的能力考核,而是围绕基础能力、典型场景和复杂综合任务构建分层测试框架。相比传统测试更关注模型“答得对不对”,“方升”的视角更进一步——推动智能体测试向综合能力测量、过程分析和问题诊断拓展。

换句话说,它不只看结果,还看智能体在完成任务过程中的推理、规划和纠错能力。

为什么公开征集?

打开网易新闻 查看精彩图片

智能体应用场景正在快速分化,从代码生成到办公自动化,不同领域的任务形态差异巨大。信通院此次公开征集,核心目的是持续汇聚高质量任务资源,增强基准的专业性、代表性和产业适用性

这意味着,企业或研究机构如果有典型的智能体应用场景或测试用例,有机会直接参与到国家级基准的构建中。

对行业而言,一套更贴近真实产业需求的评测体系,或许比单纯的榜单分数更有参考价值。