人工智能系统现在能让你信以为真,觉得它们是真人。据《独立报》报道,两个大型语言模型已通过图灵测试,该测试旨在判断机器是否能“展现出与人类同等的智能”。AI 这项重大进展挺让人担忧的,因为把大语言模型拟人化,容易骗到人,还会让人搞不清啥是真的、啥是假的。
人还是机器
测试里,一个人要跟一个真人和一个机器聊天,但不知道谁是谁,斯坦福大学是这么说的。要是这人分不出来,那就算机器过关了。研究人员测了四个 AI 系统,发现新一点的大语言模型能在短对话里装得挺像人,这项研究发在 PNAS 期刊上。
“只要提示词给对了,先进的LLM就能展现出和人类一样的语气、直率、幽默和会犯错的样子,”研究作者卡梅伦·琼斯在一份新闻稿中表示。“虽然我们知道LLM能轻松聊起几乎所有话题,但这项测试还发现,它们能装得像模像样地展现出社交行为特点,这大大改变了我们对AI的看法。”这次测试了四款AI模型:GPT-4.5和Llama-3.1-405B是当时最先进的模型,另外还有老款基线模型GPT-4o和ELIZA——ELIZA是上世纪60年代的一个简单聊天机器人。
在这些模型中,“GPT-4.5 在 73% 的情况下被判定为人类,也就是说,测试者把它认作‘人类’的次数明显更多,甚至超过了选择真正的人类参与者,”新闻稿称。Llama-3.1-405B,“在相同的提示下,有 56% 的几率被判定为人类”,使其“在统计上和真人没什么两样”。作为对照的基础系统表现明显逊色,ELIZA 只有 23% 的几率被误认成人类,而 GPT-4o 则有 21% 的几率被误认。
无人区
AI模型冒充人类是让人担心的事。图灵测试就是让模型“撒谎”的游戏,琼斯在新闻稿中表示,“说白了,模型好像特别会撒谎。”要是AI真能这样,最大的风险就是“假人”会越来越多。因为骗人太容易了,我们“需要更加警惕”,而且“大家别太自信,觉得自己聊的是真人,而不是AI。”不过,AI还没到能自己主动骗人的地步。
虽然这些聊天机器人确实通过了图灵测试,但它们也需要特定指令才能达成这一结果。据《独立报》报道,每个系统都被“要求扮演一个角色,或采用特定的身份和说话方式”。这些提示“之所以有效,部分是因为它们引导系统像人类那样犯错”。当模型没有收到这些提示时,它们被当成人类的几率就低多了,GPT-4.5的识别率降到36%,Llama-3.1-405B则降到38%。该研究的合著者本·伯根在新闻稿中说,这些模型“能装得像人,但可能不太明白怎么才能装得更像人”。
热门跟贴