加州大学圣迭戈分校的研究人员首次拿出了经过同行评审的实证证据,证明现代AI系统能通过图灵测试。这是英国数学家艾伦·图灵在1950年提出的经典测试,看机器能不能把对话进行得够逼真,让人没法轻易分辨出它不是真人。

在近500人参与的一系列受控随机实验中,询问者通过简短的文字聊天,要判断出两个聊天对象里哪个才是真人。GPT-4.5有73%的几率被当成真人——也就是说,询问者选它当真人的次数,明显比选聊天窗口对面那个活生生的人还多。

测试如何进行

测试如何进行

这个实验的设定,完全照搬了图灵当年的框架。每个询问者都对着一个分屏,同时跟两边聊——一边是真人,一边是AI——聊个五分钟或十五分钟,然后猜谁是谁。研究人员还专门搞了个在线界面,用起来就跟咱们平时用的聊天软件一个样。

研究测试了四种模型:GPT-4.5 和 LLaMa-3.1-405B 作为最先进的系统,以及 GPT-4o 和 ELIZA——一款基于规则的 1960 年代聊天机器人——作为较老版本的对照基准。为了验证结果在不同人群里是否都成立,研究找了两拨互不相关的人:加州大学圣迭戈分校的本科生,还有一批通过 Prolific 平台招来的更广泛的线上参与者。

LLaMa-3.1-405B 有 56% 的几率被当成真人——从统计上看,跟它同场竞技的真人没啥区别。老版本的系统就差远了:ELIZA 只有 23% 的几率被认成真人,GPT-4o 则是 21%。

角色提示词是决定性因素

角色提示词是决定性因素

测试能否通过,全看指令怎么给。每个大语言模型都会收到一个角色提示词,让它模仿某个特定人物的性格和说话方式。GPT-4.5被要求装成一个话不多、很懂网络的年轻人,说话带点随意的网络用语,还会偶尔犯些人类才会犯的小错。

没了这些指令,表现一下子就拉胯了。GPT-4.5没了角色提示词,胜率直接掉到36%,LLaMa-3.1也跌到38%。这些模型在指导下能骗过人类,但没了指导,就再也装不像了。

这些模型并非通过展现卓越的智能而获胜,通讯作者卡梅伦·琼斯(现为石溪大学心理学助理教授)解释说。它们赢就赢在会像人一样犯错。合著者、加州大学圣迭戈分校认知科学教授本·伯根说白了:这些模型有本事装得像人,但显然不太能自己琢磨出怎么装才像。

现在它到底在测啥

现在它到底在测啥

这项研究逼着大家重新琢磨,2025年的图灵测试到底在测啥。当初设计这个测试时,它问的是机器能不能跟人一样聪明。现在,AI回答大多数问题又快又准,这测试测的越来越是“像不像人”——也就是社交、情感和对话上的模仿能力——而不是纯粹的脑力。

这种转变在现实世界中带来了令人不安的影响。琼斯指出,那些能冒充人类的模型是在长达五到十五分钟的对话中做到的,而不是在简短的交流中,这让欺骗更加可信。“让这些模型在对话中表现得和人类一模一样,其实挺容易的,”他说,“当你在网上和陌生人聊天时,大家可别太自信,觉得自己肯定是在跟真人说话。”

伯根补充说,这事儿可不只是出于好奇那么简单:坏人已经能用机器人冒充真人,骗到个人信息、影响政治观点、引导消费行为,而且装得还挺像——《美国国家科学院院刊》的研究结果也证实,这些手段现在随便一个常见的AI模型都能用上。