给Agent加记忆,业界的主流做法是让它记住"用户说过什么"。但工业场景里更缺的记忆,是"这家企业的数据语义"——指标的分子分母是什么,同一个工单号在不同表里有几种写法。

卡奥斯COSMOPlat & 工业智能首席科学家余锦泽博士在QCon上海站"Agent自主进化:从记忆到持续学习"专题中,分享了一个反直觉的实测结果:只注入实体与关系、不带指标口径,回答正确率反而低于完全不注入。模型会更自信地选错表。

他的判断是:企业语义记忆是需要治理的资产——写入有裁决、冲突有消解、经验能沉淀、错误可撤销。

记忆不在对话流里,在数仓和代码里

Mem0、Zep(时序知识图谱)、Letta/MemGPT 等框架解决的是"跨会话记住用户",记忆主要来自对话与交互流。工业多智能体要记的不是用户偏好,而是"直通率的分子分母是什么、工单号在不同表里有几种写法"。

这些语义不产生于对话,藏在数仓表结构、建表代码与工艺文档里,且没有外键、命名晦涩。学界正在讨论记忆污染(memory contamination),企业场景的代价是口径错账。

余锦泽给出的记忆结构包含六要素:对象、关系、事件、指标、动作、场景。每条记忆带证据等级——数据验证(verified)、人工断言(asserted)、缺口(gap)。与业界情景记忆/语义记忆分层的区别在于:置信等级由真实数据裁决产生,不由模型自评。

写入把关:大模型只提议,真实数据裁决

写入侧有四道判据,缺一不可:取值重叠度须过阈值、子键不唯一、父键接近唯一、列名有据可依。通不过的降为候选,不入正式记忆。

踩过的坑之一是时序假象。同一对字段在单日窗口下取值完全重合,看上去就是一条真关系,窗口拉长到一个月即崩塌。因此采样窗口不足一律不予写入。

冲突消解有三招:

  • 时间轴校验,排除巧合性重合
  • 双源融合,代码中的 JOIN 证据优先于命名推断
  • 对抗评审,独立评审多数否决即打回重抽

另一个坑是人工断言冒充数据验证。早期实现允许把人工确认写成 verified,记忆置信被悄悄稀释。现在这条纪律写进接口签名——人审只产生"断言",verified 只能由数据裁决产生。

与业界方案的分工上,时序知识图谱记忆(如 Zep 的双时序边)回答"事实何时有效";这套方案在企业库场景回答"这条记忆该不该写入"。两者是记忆生命周期的两端,可互补。

共享与调度:按对象锚定动态构建上下文

多个智能体读写同一套语义,"工单"在所有 Agent 中是同一个"工单"。写权限唯一收口——大模型唯一的写路径是把自然语言翻译成带类型的受治理操作,预览、人审后落盘,全程可回滚。

使用侧按问句锚定对象,沿已验证关系召回子图,挂上指标口径与术语,成套注入。只注入锚定命中的子图而非全图,兼顾上下文长度与成本。

第三个坑是存而不用:数百条中英术语词典建成后,检索链路曾长期没有消费它。由此提出"消费方审计"——每新增一类记忆,必须答得出"它的消费方在哪"。

记忆还用于指代消解,本体即实体注册表。多轮对话中的指代("它/该产线")显式回填上文命中的对象,不引入通用 NLP 组件。中文表名后缀剥离——"销售订单事实表"须按"销售订单"命中。

答案同屏给出指标口径卡(计算口径、出处表列、血缘入口);实体未在记忆中命中即明确拒答,不做无锚定的自由生成。

经验沉淀:教训固化为代码而非文档

把建模教训做成可插拔的提示词组件注入构建流程。对比实验显示:注入"建模规范"组件后,对象与关系候选大幅收敛、已验证占比明显上升、关系动词全部落入白名单。

踩过的坑各有归宿:时序假象固化为采样窗口判据,断言冒充固化为接口签名,存而不用固化为消费方审计清单,跨引擎模型名错配固化为运行时模型族校验,数据对不上账固化为分层对账检查项。

证据回流路径是:用户反馈→评审队列→记忆修订→下游即时生效。评审否决一条关系,引用它的查询立即被拦截。版本快照与一键撤销保证记忆修订可逆。

持续学习的度量靠自建金标评测集——Spider、BIRD 等公开基准覆盖不了企业口径与脏数据,金标先在库上实跑校准。评测暴露的"记忆的病"往往是数据的病:汇总层与明细层对不上账,处置是把分层对账固化为数据质量检查项。

边界与取舍:什么时候不需要这套记忆

写入把关有覆盖率代价。宁缺勿滥会把部分真知识挡在正式记忆之外,选择是"缺口透明"而非"虚假完整",代价是冷启动阶段记忆覆盖有限。

前置条件是:指标口径要有人拍板,这是管理问题不是技术问题。单表能答、口径唯一的场景,一条 SQL 就够。

共享记忆的写治理成本同样存在:写权限必须唯一收口、高风险改动必须人审,换来一致性与可追责,代价是写入吞吐受限,不适合高频自动写入的场景。

遗忘与审计之间存在张力。错误记忆要能撤销,但审计要求留痕,采用"降级候选+版本快照"而非物理删除,存储与检索都要为历史版本付成本。

判据阈值是工程经验值。取值重叠度、父键唯一性等判据的阈值来自实践调优而非理论最优,跨行业迁移时需要重新标定,且每条判定都要留下依据供复核。自建合成基准可复现、金标可校准,但规模有限,不等于真实客户库表现。

收束成一句:记忆不是缓存,是需要治理的资产。