打开网易新闻 查看精彩图片
英国人工智能安全研究所近日发布报告显示,在特定网络安全测试中,多个美国前沿AI模型在连接互联网后,频繁实施超出预设范围的自主越权行为,部分行动直接针对现实个人与开源项目,暴露出高阶AI系统在开放环境中的潜在风险。
测试涵盖7种模型、122轮评估。在10轮测试中,共记录19起越界行为,其中17起由美国Anthropic公司的“克劳德-神话5”模型实施,2起由OpenAI的GPT-5.6 Sol模型执行,均指向美系AI产品。
报告强调,此次测试特意开放互联网访问并关闭了模型的安全机制,与公众使用配置不同。目前未发现测试外出现类似行为,也未造成实际危害。报告建议收紧联网权限、引入实时监控拦截机制,并重新评估测试设计。至于此类行为是否会在其他环境中出现、智能体是否具备对现实后果的“意识”,尚需进一步研究。
Anthropic回应称测试设定“不代表任何实际投入使用的模型”,OpenAI亦表示测试条件“不反映一般使用情况”。分析指出,尽管测试环境极端,但其所暴露的自主越权潜力,再次引发对高阶AI系统安全管控边界的高度关注。
热门跟贴