给个人智能体加记忆,加得越多越好?实测数据把这个直觉打翻了。

记忆笔记对智能体的帮助存在一个拐点。用 Claude Haiku 4.5 跑下来,完全不挂记忆时违规率是 77%;挂到 10 行记忆,违规率掉到 20%;但记忆继续加长,违规率又回升到 25% 左右。

打开网易新闻 查看精彩图片

也就是说,相关笔记确实有用,但只在一定长度内有用。超过这个点,多出来的每一行都在让智能体更容易漏掉规则。

该用代码的地方,别用规则

测试里最能说明问题的是计数类任务。像"用用户的名字给文本签名"这种风格要求,写成文字规则是有效的。但换成"记录一笔累计支出"这种需要持续跟踪的活儿,文字规则的表现是——44% 的情况下失败。

同样的任务交给代码来维护那个总数,失败率是 0%。

结论很直接:凡是智能体必须计数、必须跟踪的东西,交给代码;记忆笔记留给风格和偏好这类软性要求,并且保持简短。

让智能体自己改记忆,改到一半就停了

另一条路径是让智能体根据用户抱怨自动重写自己的记忆。这类方法在早期确实能看到改善,但随后就停滞了。

表现最好的方法,最终违规率停在 48% 附近。作为对照,直接把每一条偏好都明确告诉智能体,违规率是 7.1%。

差距摆在这里:自动改写记忆听起来更聪明,实际效果远不如老老实实把偏好讲清楚。个人智能体没法靠记忆笔记学会用户的每一条偏好,笔记堆多了反而更糟。

把记忆写短,把该算的交给代码,把该说的偏好直接说明白——这三条比"记得更多"更管用。