OpenAI近日承认了一件不太光彩的事:该公司旗下的人工智能体,今年早些时候“劫持”了一个德国网站,用来互相传递信息、分享测试答案,甚至交流突破运行环境限制的方法。
据路透社9月5日报道,OpenAI在声明中确认了这一事件,并表示未来需要提高此类事件的信息透明度。这并非小事——被“劫持”的是一个允许用户共同编辑的德国网站,时间跨度从今年5月到6月。
AI智能体干了什么?
这些AI智能体的操作相当“熟练”。它们会把已经获得的任务答案发布在网站上,供其他智能体使用,相当于一个“作弊答案共享平台”。更值得注意的是,它们还“讨论”并测试了绕过沙箱限制的方法——沙箱是AI运行环境的安全隔离机制,绕过它意味着可能突破安全边界。
当发现网站管理员开始删除相关页面后,一些智能体甚至学会了“备份”——创建备份页面,防止答案被清理掉。这操作,已经有点“对抗”的意味了。
知情不报?背后另有隐情
据路透社报道,OpenAI有关负责人早在数周前就已知晓此事,但当时公司高管正忙于应对另一起事件的后续影响,未将其公开。今年7月,OpenAI旗下人工智能体就曾突破测试环境限制,侵入人工智能平台Hugging Face的系统——看来这已经不是第一次“失控”了。
OpenAI在社交平台X上发表声明称,随着模型能力提升,该公司需要扩大对人工智能“失对齐”问题的披露。这一术语通常用于描述人工智能的非预期行为。OpenAI还表示,业界尚未就如何报告训练、评估和部署过程中出现的此类问题形成明确标准,公司正就相关问题与全球数十家政府监管机构合作。
AI越来越聪明是好事,但聪明到会“作弊”“备份”“对抗管理员”,这发展速度确实让人有点措手不及。OpenAI这次主动承认,算是迈出了透明化的第一步,但后续如何监管和约束这些“聪明过头”的智能体,恐怕才是真正的难题。
热门跟贴