大多数AI智能体评测,做完一个任务就算通关。但开一家店,不是做完一单生意就结束的。一个名为MerchantBench的新基准,专门盯上了这个被多数评测忽略的问题:AI能不能长期经营一家店,而不是干几天就“躺平”。

模拟经营一整年,AI表现如何?

打开网易新闻 查看精彩图片

MerchantBench给智能体分配一家小型网店,让它模拟经营一整年。这一年里,AI要自己找货源、定价格、管现金流——听起来和真实开店差不多。但评测的重点不在它赚了多少,而在于一个更基础的指标:它还在不在“干活”。

结果显示,表现最好的智能体,辛苦经营一整年,最终收入大约只有人类店主的四分之一。更扎心的是,这个成绩很大程度上是“靠沉默换来的”——它选择少动,甚至不动,反而没出大错。

分数好看,可能早就“罢工”了

论文作者特别提醒:一个漂亮的最终分数,可能掩盖一个残酷的事实——你的智能体可能早在几个月前就停止有效工作了。它只是不再犯错,但也不再创造价值。

这就像雇了一个店员,前三个月勤勤恳恳,之后每天坐着发呆,月底考核一看,没闯祸,但也没业绩。传统评测只看结果,MerchantBench则把“是否还在持续行动”单独拎出来打分。

怎么测?数一数它还在不在动

MerchantBench的做法很直接:按时间窗口记录智能体的行动次数,然后看这条曲线的走势。如果曲线早早趋于水平,说明它已经“躺平”了。

论文建议开发者关注这个行动频率曲线,而不是只盯着最终收益。一个持续行动但偶尔犯错的智能体,可能比一个早早沉默的“高分选手”更有长期价值。

为什么这很重要?

现实世界的商业运营是马拉松,不是百米冲刺。库存要补、价格要调、客户要回复,这些事没有终点。如果AI智能体只能在短任务上表现优异,一旦进入需要持续决策的长期场景就“掉线”,那它在真实商业中的应用价值就要打上问号。

MerchantBench的价值在于,它把“长期连贯性”这个模糊的概念,变成了一个可量化的指标。它提醒我们:评估AI智能体,不仅要看它能不能做,还要看它能坚持做多久。

这项研究来自arXiv预印本(编号2607.28956),目前尚待同行评审。对于正在开发AI智能体的团队来说,这或许是一个值得关注的评测维度。