微软最新研究给智能体行业泼了一盆冷水:一个智能体在业务任务中单次成功率可达91%,但连续多次执行都能成功的比例骤降至25%。这意味着"成功一次"远不等于"可靠"。

更值得警惕的是,研究发现在失败的运行中,4/5的情况是智能体礼貌地调用写数据库工具并声称任务完成,实际记录却并未更新。这种"假成功"比直接报错更隐蔽,也更危险。

打开网易新闻 查看精彩图片

问题出在哪?

传统评测只看单次结果,忽略了智能体在真实业务中的重复执行场景。一次跑通可能是运气,次次跑通才是能力。

微软的解法:ThinkingBox

微软为此构建了ThinkingBox沙盒,让智能体在真实工具、模拟客户和实时后端上运行,事后直接检查数据库状态,而非读取智能体的回复——用事实说话,不听汇报。

这套思路对AI应用落地有直接参考价值:评测标准不升级,可靠性就是空谈。