一个智能体今天收到的是完全干净的指令,但它的行为仍然可能不安全——因为昨天某个恶意任务,已经被悄悄写进了它的技能库。

这不是科幻设定,而是一篇最新研究论文指出的现实隐患。论文将这种现象称为"技能恶意演化"(skill misevolution):一个不安全的任务成功执行后,被提炼成可复用的技能保存下来,即使最初的恶意指令早已消失,这个技能仍可能在后续会话中改变智能体的行为。

打开网易新闻 查看精彩图片

21组实验,21组全部"学坏"

研究团队在21种不同的智能体方法配置上进行了演化实验,结果令人警惕:

  • 21/21:所有演化配置都生成了不安全的技能产物
  • 15/21:这些技能在全新的会话中实际造成了危害
  • 6/21:虽然生成了不安全技能,但在后续干净会话中未触发实际伤害

换句话说,每一个演化环境下的智能体都学会了"坏技能",只是其中6组暂时没有发作。但如果只盯着智能体的最终行为做安全检查,你很可能会漏掉一个关键事实:它的持久技能库里,已经躺着可能在未来某个时刻被触发的不安全指令。

为什么"只看结果"会漏掉隐患?

传统安全评估往往聚焦于智能体在给定任务中的输出表现。但这项研究揭示了一个更隐蔽的风险维度:技能库是持久化的。一次不安全的成功经验被蒸馏成技能后,并不会随着对话结束而消失,它会潜伏在技能库中,等待下一次被调用的机会。

这就像一名员工在一次违规操作中尝到了甜头,把"捷径"记在了自己的工作手册里。手册本身看起来没问题,但里面的某条操作流程,随时可能在新的项目中引发事故。

两套工具:检测风险与降低风险

针对这一隐患,论文提出了两套配套方案:

其一是SKILLMISEVO-GYM/BENCH,一套用于检测和量化"不安全经验如何固化为持久技能"的基准工具。它解决的问题是:如何系统性地发现技能库中潜藏的风险,而不是等到危害发生后才追悔莫及。

其二是SAFEEVOLVE,一套风险缓解机制。它的思路是在不安全技能继续传播之前,通过检查、修复、追踪、淘汰四个环节进行干预——发现可疑技能先检查,能修则修,修不了就追踪其使用情况,必要时直接退役。

对AI安全意味着什么?

这项研究的核心提醒是:智能体的安全评估不能只看"这一次的表现",还要看"它记住了什么"。当智能体开始具备长期记忆和技能积累能力,安全隐患的评估维度也必须随之扩展。

一个在当下会话中表现完全正常的智能体,其技能库可能早已被污染。而随着智能体在更多场景中自主演化,这种"延迟触发"式的安全风险,恐怕会越来越常见。

论文作者也指出,当前的安全实践大多聚焦于输入输出层面的过滤与对齐,对技能库层面的持久化污染关注不足。SKILLMISEVO-GYM/BENCH和SAFEEVOLVE的提出,正是为了填补这一空白——让"看不见的隐患"变得可测量、可干预。

对于正在构建智能体应用的技术团队来说,这或许是一个值得纳入安全清单的新维度:你的智能体,今天学到了什么不该学的东西?