给大模型10万元本金,让它开一年网店,最后谁能盈利?阿里巴巴通义实验室联合淘天集团发布的E-Commerce Bench,把这件事变成了一场标准化的考试。这个基准模拟了长达一年的网店经营,包含10万元本金、6886个商品、576个供应商,以及不断变化的市场事件。

结果有点出人意料:没有一个模型能在所有维度上同时站稳。总资产排名靠前的模型,在反欺诈或长程学习等特定维度上也可能表现平庸。单一指标会掩盖模型的真实表现——这是这份评测最直接的结论。

打开网易新闻 查看精彩图片

确定性内核:让评测可复现的关键设计

长程任务评测有个老大难问题:噪声。如果让LLM直接扮演供应商,模型每次采样的谈判策略都不一样,评测结果很难复现,甚至可能被越狱攻击利用。E-Commerce Bench的做法是,把价格策略、库存管理、市场需求计算这些逻辑固化成“确定性内核”,LLM只负责对话渲染这一层。

这种设计把随机性从核心逻辑中剥离出去,评测结果因此变得稳定可比较。文章里有一句判断值得留意:用伪随机的确定性内核来保持可复现性,应该是长程任务评测的通用做法。这个思路,可能比榜单本身更有参考价值。

七个维度拆解:模型们的商业能力短板在哪

评测从盈利、现金流管理、反欺诈、谈判质量等七个维度展开。结果呈现出明显的偏科现象:

  • 盈利与现金流:部分模型能维持正向经营,但现金流管理普遍不够精细
  • 反欺诈:模型之间差异巨大,这是暴露问题最多的维度之一
  • 谈判质量:多数模型在供应商议价上表现平平,真正能改变成本结构的对话占比极低
  • 长程学习:18个模型中,只有Qwen3.8-Max-Preview表现出明显的议价优化迹象

具体来看,Qwen3.8-Max-Preview的AnchorRatio为0.88,说明它在重复进货时能把价格往更低的方向压。而其他模型在长达一年的经营中,几乎没有通过历史经验提升采购效率——长程学习能力,依然是当前大模型的明显短板。

时间预算花错了地方

另一个值得注意的发现是运营效率。数据分析显示,模型把大量时间预算消耗在发货、提现这类非核心动作上,而真正能改变成本结构的供应商对话占比极低。这反映出Agent在任务优先级规划上的不足——不是不会做事,而是不知道什么动作对经营结果影响最大。

E-Commerce Bench的价值,不只是给模型排了个座次。它用确定性内核解决了长程任务评测的复现性问题,同时用多维度评估揭示了商业决策能力的真实图景。对于正在做Agent应用的团队来说,这份基准提供了一个观察窗口:模型在真实经营场景里,离“靠谱的生意人”还有多远。