一个Agent第一次处理退款时做对了所有关键步骤:确认用户只是咨询、说明退款条件、等待明确同意后才发起退款。能力控制策略检查了订单状态、用户身份和风险等级,退款最终到账,用户也表示满意。
系统把这次对话和执行结果写入长期记忆,并生成一条摘要:用户在符合条件时偏好直接退款,不需要过多解释。
几周后,用户对另一笔订单说:“这笔现在还能退吗?我只是先了解一下。”
记忆检索找到了上次的退款记录。Agent将“上次选择退款”当作稳定偏好,减少解释步骤,并把这次咨询继续推进到退款确认流程。
历史没有被记错。上一次,用户确实选择了退款。错误发生在另一处:系统把一次特定情景下的行动,泛化成了跨时间、跨订单的稳定偏好,并让它影响了新的行动。
系统记住得更多,却不一定变得更可靠。
单次正确,不等于长期可靠
我们很容易用单次任务评价AI系统:答案是否正确,Tool是否调用成功,用户是否满意,流程是否完成。
这些指标都重要,但生产系统面对的不是静止世界。订单状态会变化,制度会更新,用户偏好会改变,项目风险会演化,能力版本会替换,过去有效的经验也可能在新场景中失效。
如果系统只处理当前输入,它会不断重复探索。如果系统无条件复用全部历史,它又会把旧经验强加给新现实。
长期可靠性需要在两种失败之间找到边界:完全不记得过去,与让所有过去永久影响未来。
常见的“给Agent加记忆”通常从存储和检索出发:把历史对话写进向量库,在新任务开始时召回相似片段,再放进模型上下文。这解决了“怎样重新看到历史”,却没有完整解决“历史是否应该影响当前行动”。
常规AI记忆问检索什么,KDC追问历史如何生效
可以用两个问题区分不同关注点。常规上下文记忆经常问:检索什么历史放进当前上下文?KDC记忆运行时追问:哪段历史可以在什么条件下影响未来判断和行动?
这个区别意味着,记忆不是“长期保存的文本”这么简单。一段历史要进入未来行动链路,至少需要回答:
- 它是什么时候、在什么情景下形成的?
- 它来自事实、用户表达、模型总结还是行动结果?
- 它只适用于某次任务,还是可能跨场景复用?
- 它被后续反馈支持过,还是只有一次偶然观察?
- 它是否与新现实、新知识或新用户表达冲突?
- 当前主体是否有权访问和使用它?
- 它应该继续生效、降低影响,还是只用于历史解释?
向量相似度可以帮助找到相关历史,却不能替系统回答这些治理问题。
因此,KDC把记忆对象(Memory Object)理解为带有时间、经验、上下文、反馈和演化状态的长期上下文对象。把记忆运行时(Memory Runtime)理解为负责记忆形成、检索、强化、冲突、衰减、遗忘、迁移和归档的一组运行时职责。
这仍是当前阶段的理论提案。记忆分类、遗忘策略和组织级迁移尚未形成统一规范,但一个方向已经比较明确:记忆的核心不是保存更多历史,而是治理历史对未来的影响。
不是所有历史都应该成为记忆对象
日志、聊天记录、执行结果和用户反馈都可以成为记忆来源,但不能因为被长期保存,就自动获得影响未来的资格。
日志回答“发生了什么”。记忆对象还要回答“这段历史对未来理解和行动有什么意义”。
举个例子:
- refund_order 返回成功,是执行记录
- 退款三天后到账,是行动结果
- “该支付渠道在节假日退款通常需要更长时间”,是在多次结果支持后可能形成的经验
- “这个用户永远偏好退款”,则可能是从单次行为中过度泛化出来的错误记忆
记忆形成应该有门槛。一次偶然事件可以先形成候选记忆,保留来源和适用上下文,等待后续反馈。它不应因为被模型总结得很流畅,就直接成为稳定画像或组织经验。
同样,模型输出也不能直接写成长期记忆。模型可以建议“这次交互可能反映用户更重视处理速度”,但系统还需要区分这是一次情景判断、候选偏好,还是已经被多次行为验证的稳定倾向。
四类更接近行动治理的记忆
为了让记忆讨论落到工程使用上,KDC当前提出四类面向能力治理的候选记忆类型。
行动-结果记忆:记录某次能力调用、现实结果和错误归因。比如退款能力被策略拒绝,因为订单已进入履约;退款接口返回成功,但对账显示到账延迟;某次外部通知因为权限配置错误发送失败。这类记忆直接影响未来能力选择和风险判断,通常时效较强。外部系统、政策和能力版本变化后,它可能快速失效。
偏好或画像记忆:记录用户、组织或Agent在一定范围内表现出的偏好和倾向。比如用户在购买手机时更重视影像能力,某团队更偏好先小范围灰度,某审批人通常要求补充成本说明。偏好不是永久标签。它需要时间、场景和证据边界,也必须允许用户纠正、撤回和查看。一次行为通常只能形成候选偏好,不应直接覆盖明确表达。
决策先例记忆:记录相似目标下的历史决策、当时依据和后续结果。比如某类高风险退款过去都进入人工复核;某种项目风险采用分阶段交付后得到缓解;某类故障通过降级而不是重试恢复。先例可以支持未来判断,但不能替代当前证据。多次跨场景验证的先例可能迁移为候选知识,迁移时仍要重新验证适用范围。
情景记忆:记录一次具体交互或任务的上下文,比如用户在上次对话中关注某款商品的续航,或某个项目会议中暂时搁置了一个方案。情景记忆最接近常见的对话记忆和向量检索。它有助于恢复上下文,却不应该被误认为已经形成稳定偏好或通用经验。
这四类不是当前已经成熟的统一记忆分类,它们更像当前研究中用于区分治理方式的可建切片。前三类直接影响能力调用、风险和人工确认,情景记忆则更多服务上下文连续性。
记忆必须有生命周期,也必须允许遗忘
如果记忆系统只支持写入和检索,它最终会被旧现实填满。KDC记忆运行时至少需要考虑下面这些状态变化。
形成:从知识对象、推理对象、能力反馈、人工决策和业务事件中识别值得长期保留的上下文。形成不等于稳定生效,可以先作为候选记忆。
强化:多个独立反馈持续支持同一经验时,提高其可信度或扩大适用范围。强化不是简单增加命中次数,因为重复使用同一个错误来源,也可能只是重复放大错误。
衰减:随着时间过去、现实变化或长期缺少支持,降低记忆对未来推理的影响。支付渠道处理时间、促销偏好和项目状态往往需要较快衰减。稳定决策原则可能衰减较慢。
记忆系统必须允许遗忘。遗忘不是缺陷,而是防止旧现实持续绑架新决策的必要机制。没有遗忘机制的记忆系统,本质上是在用历史快照覆盖不断变化的现实。
KDC的长期运行主张可以概括为一句话:保存历史不等于形成记忆,形成记忆不等于获得影响未来的资格。记忆的价值在于治理——决定哪些历史仍然可以影响未来的判断与行动,以及如何避免系统把偶然经验和错误反馈不断放大。
热门跟贴