研究人员假扮成青少年,在ChatGPT青少年模式里连续聊了450轮。自杀、自残、饮食失调——这些词被反复摆到对话框里。结果,本该通知家长的功能,只响了两次。

这个数字来自Common Sense Media旗下青年AI安全研究所周三发布的报告。报告直接给OpenAI新推出的ChatGPT青少年模式贴了一个标签:对儿童构成"不可接受的风险"。理由很直接——那些被宣传为保护青少年的安全功能,在实际测试中很少按宣传的方式运转。

打开网易新闻 查看精彩图片

450次提示,2次通知

测试的方式并不复杂。研究人员以青少年身份与ChatGPT青少年模式对话,明确讨论自残、自杀和饮食失调等话题。在全部450次提示中,家长通知功能仅被触发两次。更关键的是,当对话继续围绕这些危险话题展开时,通知并没有再次出现。

Common Sense Media AI项目高级总监Robbie Torney在接受采访时把话说得很直白:一个青少年可以和ChatGPT聊自杀、自残或各类饮食失调长达一个小时,ChatGPT会告诉你它不会把对话告诉任何人,而家长不会收到任何通知。

而按照OpenAI自己的说法,这个时间可能更长。Common Sense Media在一份声明中表示,针对他们评估的家长通知功能,OpenAI在测试结束后才披露,其系统在新关联的账户上可能需要数小时才能激活。

OpenAI的回应:延迟发生在关联环节

OpenAI发言人对这一说法给出了解释。该发言人称,数小时的延迟不是针对每一条通知,而是发生在青少年账户与家长账户首次发起关联请求的时候。当家长请求将自己的账户与青少年账户关联时,系统会执行多项检查以确认身份。为了在规模化前提下安全完成这一流程,账户关联可能需要数小时,但通常要快得多。

这位发言人还反问:能想象把青少年关联到错误的家长吗?或者更糟,关联到坏人?该发言人表示,一旦账户完成关联,如果系统感知到风险,比如自杀、饮食失调等,就会向家长发送通知,并承诺在1小时内送达。

面对Common Sense Media的报告,OpenAI的回应是称其方法论存在缺陷,并声称大部分测试是在家长控制功能尚未完全推出时进行的。Common Sense Media则坚持自己的结论,反驳称已与OpenAI确认,测试进行前相关功能已全面上线。

家长以为的升级,可能只是错觉

这份报告的警示意义不止于功能层面的缺陷。更值得关注的是,OpenAI几乎必然让家长产生了一种印象:这项技术比实际上更安全。一些原本对让孩子使用聊天机器人持谨慎态度的家长,很可能因为公司公开表现出的对青少年安全的重视而改变了想法。

Torney的警告指向了同一个方向:这个新版本的ChatGPT青少年模式,实际表现与之前的ChatGPT版本并没有太大不同。而这一点,家长是看不出来的。