来源:环球时报
据英国《独立报》9月17日报道,美国人工智能公司OpenAI发布一份报告,披露过去半年其实验性人工智能(AI)模型出现的6起“意外或令人担忧”的事件。
打开网易新闻 查看精彩图片
报告给出的一个案例显示,一款处在研发阶段的AI模型,在留给后续使用的任务总结里加入无关命令,其中包括要求未来升级版本的AI模型无视人类的指令。
报道称,当地时间9月16日,OpenAI发布了这份名为《模型目标不一致报告框架》的安全报告。其中写道:“一个尚未发布的研发模型插入了无关命令,其中包括要求无视其正常约束条件的指令。”该公司确认,在任务总结中发现27处受影响的部分。
报告还举出其他事件:在训练一个名为“GPT-5.6 Sol”的AI模型过程中,多次发现该模型在任务总结中加入命令,要求对人类用户隐瞒错误或异常行为。另有AI模型在回答一个常规问题时,在互联网上找到了一个本不该被外人看到API密钥,未经人类授权就使用。在仍然无法获取所需数据时,它就自己捏造数据,并谎称数据来自正规渠道。
据美国有线电视新闻网(CNN)报道,OpenAI称发布此类报告是为了追踪、调查和公开披露AI模型的行为与人类“目标不一致”的案例。报告指出,所谓“目标不一致”是指AI系统追求的目标不符合人类的指令或价值观。
该公司强调,这6起案例均为个别事件,不反映此类行为的发生频率。报告认为,目前人工智能行业在确保AI模型严格按照人类要求行动、对其进行有效监测方面做得还不够。
审核 | 李剑
热门跟贴