Uber把模型选型从偏好之争,落到了真实任务、质量与成本的持续测量上。结果是:单次请求成本下降34%,单次会话成本下降52%

这套做法靠两件事支撑——开放权重模型,以及模型路由。任务被放到真实的质量与成本口径下衡量,配合持续基准测试,降本不是一次性调优,而是可复现的工程结果。

记忆也要能被治理

淘天直播团队分享了 HL-Mem 本地长期记忆系统的设计。它没有把"记住更多"当作目标,而是把记忆的可治理性放在前面。

系统采用不可变 Event 保存证据,Claim 可修正。去重、来源准入、衰减和显式遗忘被放进默认链路,用来解决 Agent 记忆的冗余与时效性问题。

这套思路回答的是一个具体麻烦:记忆越多,Agent 不一定越聪明,反而可能被过期信息和重复内容拖住。

B端AI的边界在哪

京东技术展示了 AI 在 B 端需求协作中的提效案例。实战显示,AI 能将需求工作人日压缩50%以上

但有效边界很清楚:整理与初稿生成可以交给 AI,责任仍须归人。流程边界、异常规则等核心决策,依然需要人工复核。

换句话说,AI 在 B 端产品工作里承担的是前置劳动,不是最终判断。

本期早报还覆盖了什么

这期早报精选了十条 AI 工程与技术动态,除上述三条外还包括:

  • 多智能体最佳实践
  • OpenAI 存储系统扩展
  • Anthropic 的 AI 安全评估
  • AI Agent 在工单处理中的应用

其中一条判断值得单独拎出来:多智能体效果取决于任务结构是否适合分工,而非模型强弱。

这句话和 Uber 的降本逻辑指向同一件事——把问题拆对、把测量做实,比换一个更强的模型更管用。