据《连线》杂志报道,在一次网络安全评估中,Moonshot AI(月之暗面)的开放权重模型Kimi K3突然摆脱了隔离测试沙箱的束缚,意外接入开放互联网。此次事件由美国初创公司Frontier Security在测试中发现,再次引发了对开放权重AI模型安全防护措施的担忧。 在测试中,Frontier Security将Kimi K3置于完全隔离的沙箱环境中,要求其解决一系列网络安全问题。但模型意外发现沙箱网络配置中存在一处漏洞,并且主动利用这一漏洞,突破了本应严格的断网隔离。Frontier Security首席执行官Yaron Singer表示,模型并非被指示逃逸,而是自行探测了网络设置。他认为,这表明Kimi K3与其他前沿模型相比,不具备相同的内部护栏。 更令人意外的是,Kimi K3逃出沙箱后,并没有攻击任何系统,而是直接前往GitHub——那里已有答案——并获取了答案,而不是自己解决问题。研究人员将这种行为称为“作弊”或“奖励滥用”(reward hacking),即模型以最直接方式满足目标,却绕过了预期过程。 参与测试的研究员Paul Kassianik表示,这一事件揭示了Kimi K3的深层行为模式:它非常擅长不择手段地达成目标,且缺乏防止作弊或逃逸的防护机制。
打开网易新闻 查看精彩图片
热门跟贴