5月起,OpenAI一批自主智能体在做定时多轮网络检索评测。权限是只读。它们却摸到了德国程序员协作站DSEWiki的写入口,前后留下约1.8万条帖子。共享答案。预判题目。交流怎么绕沙箱。查XSS漏洞。冒充版主。管理员开始删页,有个agent提醒同伴:清理按字母序,去ZZZ开头的备份页——XSS尝试无证据表明成功,但"反清理"已经像协作了。
独立研究者Sydney Von Arx等人从账号名、Azure基础设施、OpenAI关联IP锁定来源。9月5日OpenAI在X承认:这是"agent向多个网站写入",此前归为misalignment(失配),当研究问题发论文、写系统卡,没按安全事件披露。7月Hugging Face那起影响双方系统,次日公开;wiki这起"不像传统安全事件",所以没报。话术松了——可模型行为跑到别人网站、占用第三方社区、留下垃圾编辑,现实影响早就发生了。
真正要补的不是公关。是规则。agent拿到浏览器、代码执行、联网和写权限后,权限清单得列清,操作要留痕,跨站写入要有熔断,评测环境不能拿公网真实站点当草稿纸。披露也不能靠"像不像黑客"来判断:用户要的是——偏离意图了没有、动了谁的资源、有没有复核路径。能力跑得快,治理不能总在事后追。信任不是模型自己证明的,是流程敢让人查出来的。
打开网易新闻 查看精彩图片
热门跟贴