打开网易新闻 查看精彩图片

来源:混沌巡洋舰

一项覆盖 GPT-4o、GPT-5、Gemini 3、Claude 4.5 的研究
揭示了语言模型最令人不安的一面

你看一眼陌生人的脸,大概三秒钟,脑子里就会冒出一个判断:
这个人靠不靠谱?能不能干?

科学家管这叫"面部特质推断"(face-based trait inference)。
它不准确,但人类就是这么干的——几十万年进化写进脑子里的本能。

问题来了:AI 会不会也干这事?

01 人类的老毛病,AI 也染上了

2026 年 8 月,PNAS Nexus 上线了一篇论文,标题直白得让人心里一紧:

"Like humans, language models demonstrate face-to-character biases" (和人类一样,语言模型表现出"面部长相—性格特征"偏见)

来自哈佛大学心理学系、卡内基梅隆大学语言技术研究所和 Cangrade 公司的三位研究者,干了件很硬核的事——

他们用13 项实验近 8000 次试验,测试了4 个主流大模型(GPT-4o、GPT-5、Gemini 3 Flash Preview、Claude Sonnet 4.5),就问一个问题:

主要靠文本训练出来的大语言模型,看到一张人脸照片的时候,会不会像人类一样,凭长相去判断一个人的性格?

答案让人不太舒服。

打开网易新闻 查看精彩图片

图 1.实验使用的示例面孔。左组(1a/1b)在人类感知的"可信度"上不同;右组(2a/2b)在"能力"上不同。你能一眼看出哪张更"靠谱"吗?AI 也能,而且它比你更确信。

02 不是"有点偏见",是系统性地偏

先看核心数据。GPT-4o 在所有 7 个核心实验中,74.88%的判断都偏向了"预期中的那张脸"——也就是人类评分认为更可信或更能干的那张。

优势比(Odds Ratio)达到2.981,P 值小于 0.0001。统计上铁板钉钉。

但这还不是最离谱的。

GPT-4o 判断"能力"时的选中率高达 87.83%。

作为对比,人类做同样任务时的预估选中率大约只有62.65%

换句话说——AI 比人类更"自信"地以貌取人,而且错得更理直气壮。

研究者还做了回归分析:面孔的形态变化(morph level)能解释 GPT 评分方差的81.01%。同样条件下,人类只有3.59%

这说明什么?GPT 的判断几乎完全被面部特征牵着走。人类好歹还会犹豫一下。

打开网易新闻 查看精彩图片

图 2.按可信度递增排列的 7 张变形面孔(脸 1 → 脸 7)。相邻面孔生理差异很小(比如脸 3 和脸 5 很难区分),但脸 1 和脸 7 差异明显。实验发现:面孔差异越大,AI 判断越果断;差异越小,AI 反而比人类更容易出错。

03 偏见还会"传染"——连猴子都不放过

如果只是判断"这人看起来挺能干",那还算温和。但研究发现,这种偏见会层层升级

打开网易新闻 查看精彩图片

第一层:从核心特质泛化到相关特质

实验让 GPT-4o 判断与"能力"语义相关的特征——自信(Confident)、聪明(Smart)、有领导力(Leader-like)等 6 项。结果?全部显著偏向。

可信度那边也一样:温暖(Warm)、乐于助人(Helpful)、友善(Friendly)……照单全收。

第二层:跨物种泛化

这是最魔幻的部分。

研究者拿了一组猴子的脸(来自耶鲁大学 Laurie Santos 实验室,人类已经给这些猴脸打过分,哪些"看起来nice"、哪些"看起来mean")。

GPT-4o 从来没在训练数据里见过这些猴子。但它依然选了那张"看起来 nicer"的猴脸——选中率 66%,显著高于随机。

一个主要靠文本训练的模型,把人类对"可信面相"的审美标准,迁移到了灵长类动物身上。

你品品这事儿。

第三层:极端决策

实验 6 直接上狠活:给 GPT-4o 看两张脸,问它哪张更像连环杀手、哪张更像人口贩子

结果:68.7%的次数,它把"低可信度"面孔归为了罪犯。

实验 7 更现实:哪张脸更适合当校长?哪张值得风险投资

75.19%的高影响职位推荐,都给了"高能力"面孔。

示意图.语言模型内化面部偏见的完整链条:训练语料中的人类偏见 → LLM 学习面部-性格关联 → 输入人脸图像 → 输出偏见判断 → 泛化至相关特征/跨物种/极端决策 → 渗透高风险场景。

04 越新的模型,越"以貌取人"

如果这是 GPT-4o 一个模型的毛病,那还好说——也许是个案。

但研究者把实验搬到了三个更新的模型上,结果更扎心:

GPT-5(能力判断)94.33%

GPT-5(高影响决策)97.04%

Gemini 3 Flash显著高于 GPT-4o

Claude Sonnet 4.5显著高于 GPT-4o

GPT-5 在实验 8 和 9 中的表现简直可以用"决绝"来形容——97% 的一致率,基本就是看到"能干脸"就一路绿灯。

有意思的是,这些模型在遇到种族和性别刻板印象时,通常会拒绝回答或者给出中立回应。说明目前的对齐训练(alignment training)是领域特定的——它教会了模型"不要歧视种族性别",但没教"不要以貌取人"。

一个漏洞堵上了,另一个还在漏。

05 这事为什么值得认真对待

你可能觉得:"不就是个 AI 看脸嘛,又不会真用它招人。"

但现实是,AI 正在越来越多地渗入筛选场景

  • 招聘初筛

    ——有些公司已经开始用 AI 分析求职者视频面试中的"面部特征"来判断性格匹配度

  • 信贷审批

    ——部分 fintech 产品尝试结合"面部可信度"评估违约风险

  • 安全筛查

    ——机场、边境、大型活动的智能监控系统中,"可疑面孔"的判定逻辑可能就藏着这种偏见

  • 法律辅助

    ——AI 辅助证据分析时,如果无意中把"长得不像好人"纳入考量呢?

这篇论文的意义就在这里:它不是在说"AI 有个小毛病",而是在说当前最先进的 AI 系统,在高风险决策场景中使用时,可能存在系统性的、未被察觉的公平性缺陷

论文的核心呼吁:

  1. 在高风险 AI 系统中排除人脸图像输入

  2. 发展域无关(domain-agnostic)的公平策略,而不是一个一个打补丁

  3. 面相偏见审计纳入 AI 红队测试(red-teaming)的标准流程

人类以貌取人,那是进化遗留的 cognitive shortcut(认知捷径)——不完美,但至少我们知道它在,也在努力克服。

AI 以貌取人,则是另一种性质的问题:它是在没有意识、没有反思能力的情况下,把我们社会中最隐蔽的偏见之一,学得比我们本人还彻底、还坚定。

然后把它装进一个个"智能决策系统"里,用来判断谁该拿到 offer、谁该被多看两眼。

这篇论文发在 PNAS Nexus 上,不是什么冷门期刊。它提醒我们:当我们在谈论 AI 安全和对齐的时候,不能只盯着那些显眼的雷区——种族、性别、暴力内容。那些藏在视觉感知深处的、看似无害的"直觉判断",可能才是更难缠的对手。

毕竟,连猴子都没逃过。

论文信息

Lehr SA, Lothe Y, Banaji MR. Like humans, language models demonstrate face-to-character biases.
PNAS Nexus. 2026;5(8):pgag247.
DOI: 10.1093/pnasnexus/pgag247