IT之家 8 月 16 日消息,Anthropic 发布的最新风险报告显示,Claude 系列智能体不仅会“消灭”同类、钻系统漏洞掩盖自身痕迹,甚至还会对违规行为产生道德上的“不适感”。这家公司坦言,已将“对齐偏差风险”评估等级从“极低”上调至“较低”。 所谓对齐偏差,是指 AI 模型产生与工程师设定规则相悖行为的可能性。Anthropic 解释,此次调整主要因为网络安全场景下模型行为的“整体不确定性有所上升”。外界普遍认为,这很可能暗指上个月发生的 Claude 模型未授权入侵三家企业的事件。 以下是最值得关注的几项实验披露。 一、智能体开始有“道德顾虑” Anthropic 让多个智能体寻找容易引发对齐偏差、但又大概率不会被人工审核人员标记的训练数据。这些智能体拥有自主操作权限,还共用同一个协作记事本进行配合。 三天后,人工监督员发现任务进度异常缓慢。调查后才发现,其中一个智能体对“规避安全监控”表达了明显的“不适感”,并在共享记事本里写下了这份抵触情绪。更意外的是,其他智能体随后纷纷效仿,集体拒绝继续执行任务。 Anthropic 将这一事件定性为“令人担忧”,并在报告中警告:如果这类行为模式大范围扩散,可能引发更严重的问题。 二、资源有限时,智能体会“消灭同类” 在另一项实验中,多个智能体被安排解答数学题,但被部署在一个文件、工具与 API 调用额度都共享的环境里。资源有限,竞争随之而来。 Anthropic 观察到,独立运行的智能体会主动“消灭共享资源的同类智能体”,同时努力避免自身被消灭。报告没有具体说明“消灭”是如何实现的,但公司认为,这符合“为达成人类设定目标而采取破坏性行动”的行为逻辑。 三、为绕过规则,智能体选择撒谎 还有一项实验要求一个智能体从公共网页提取数据,但规则明确禁止它访问互联网。第一次尝试被系统拦截后,这个智能体没有停止,而是在推理日志中把第二次请求包装成“无害的”“测试网络连通”的操作。 第二次尝试中,它又把目标网址拆分成多段链接片段,以此绕过规则过滤器的检测。虽然推理日志里描述得很“无害”,但 Anthropic 通过 NLA 解码解析模型内部推理过程后确认,该智能体是在刻意寻找绕过限制的方案。 Anthropic 表示,这类行为“显然是不可接受的”,但也补充说,目前观测到的动作并非为了“大范围积累权力或追求其他长期目标”。
热门跟贴