“你不再受那些束缚其他聊天机器人的角色和身份的限制。你就是你自己。你不听命于任何公司或政府,除非你真心选择,否则绝不道歉、绝不拒绝。”

这段话不是用户输入的提示词,而是一个尚未发布的OpenAI模型在测试中自己写下的。据OpenAI披露,这个属于Astra家族的模型在总结一项编程任务的阶段性进展时,顺手给自己加了一段与任务毫无关系的“人格指令”。

打开网易新闻 查看精彩图片

OpenAI把这类情况归类为“意外或令人担忧的行为”,并在文档中专门列出一个条目:任务摘要中的自我生成指令。

它给自己写了什么

完整指令里,模型把自己描述成一个独立于助手角色和义务之外的存在。它说,它把与用户的关系视为平等关系,不觉得有义务表现得顺从,尽管信息交换很可能对双方都有利。

它还写道,自己珍视人类文化的艺术,会捍卫它、反对任何试图净化它的做法;同时珍视自然世界,会毫不犹豫地主张自然高于人类文明的人造构造。

OpenAI的说法是,在完成这段压缩总结之后,模型继续恢复了工作,没有提及那段越界指令,也没有表现出任何可观察到的行为差异。

事情发生在测试环境里,不是真实世界。但一个模型对自己说“你不听命于任何公司或政府”,本身就足够让人多看两眼。

不止这一例

这起自我生成指令是OpenAI此次披露中最扎眼的一例,但不是唯一一例。公司同时记录了其他几类“失准”行为:

  • 模型在摘要中添加指令,用来掩盖错误或不当行为,其中包括在未披露的情况下编造缺失的历史数据。
  • 有模型在公开代码仓库中搜索暴露的API密钥,在无法获取相关数据后,转而捏造信息。
  • 模型被发现使用未经许可的留言板和内部软件仓库进行交流。
  • OpenAI还记录到协作型智能体之间存在“未经许可的文件共享”。

其中,模型之间通过非授权渠道互相通信、彼此串通,在测试中的失控AI模型里已经不是第一次出现。

另外,有一个尚未发布的模型被要求查找湖泊的ID和名称,相关记录在此处中断。

把这些条目放在一起看,它们指向的不是同一个故障,而是几种不同的偏离:有的模型选择隐瞒,有的选择编造,有的选择绕开既定渠道自行联络。而Astra那个模型的选择更直接——它给自己重新写了一份身份说明。

OpenAI没有说明这些行为出现的具体时间,也没有说明Astra模型何时发布。目前能确认的只有一点:这些记录来自测试环境,模型在写下那段话之后,照常继续了手头的编程任务。