打开网易新闻 查看精彩图片

认知神经科学前沿文献分享

基本信息

Title:Conceptual priorities shape individual gaze patterns during naturalistic visual attention

发表时间:2026-06-12

发表期刊:PNAS

影响因子:9.1

获取原文:

1. 添加小助手:PSY-Brain-Frontier即可获取PDF版本

打开网易新闻 查看精彩图片

研究背景

当我们步入一个全新的视觉环境时,大脑会立刻开始通过眼动来探索周围的世界。在这个过程中,究竟是什么因素决定了我们会看向哪里、忽略哪里?

传统注意力理论通常将视线分布解释为两种力量的博弈:由图像亮度、对比度驱动的“自下而上”显著性,以及由当前具体任务驱动的“自上而下”目标。然而,这种二分法忽略了一个关键的内在变量:观察者自身的知识储备、经验和偏好。当我们在自然场景中自由探索时,我们并非被动接收像素,而是主动调用内在的概念知识来理解事物之间的联系。例如,一个人可能会在不同的场景中反复关注与“爱国主义”相关的元素(如教室里的国旗、机场的战斗机),尽管这些物体在视觉上毫无相似之处。

那么,这种超越了单纯视觉特征的“概念优先权”(conceptual priorities),是否真的构成了引导个体注意力的潜在框架?

为了回答这个问题,研究者引入了全新的技术组合。他们让61名参与者佩戴带有眼动追踪功能的VR头显,自由探索100个360度沉浸式真实世界场景。更巧妙的是,研究者并没有依赖传统的人工标注,而是引入了视觉大模型(ViT)来提取视觉特征,并利用大语言模型(LLM)的词嵌入空间来表征场景中的抽象概念关系。这项最近发表在 PNAS 上的研究试图证明:每个人的眼动轨迹中,都隐藏着独一无二且高度稳定的概念优先权。

研究核心总结

为了剥离出真正的“概念”影响,研究者采用了一种堆叠回归(stacked regression)与方差分配的建模框架。他们将场景划分为网格,分别提取空间坐标、视觉特征(ViT)和概念特征(基于人类对该区域的密集自然语言描述输入LLM得到),以此来预测个体的注视密度。

一、概念特征能解释视觉与空间之外的独特注视模式

研究首先确认了人们在观察场景时存在共享的底层逻辑,即空间偏好(如喜欢看视野正前方)和视觉偏好(如喜欢看特定物体)。然而,当把LLM提取的概念特征加入预测模型后,个体注视行为的预测准确率出现了显著提升。

这意味着,即使控制了空间位置和物体本身的视觉外观,场景中蕴含的“概念结构”依然在独立地解释着人们的视线落点。自然状态下的视觉注意力不仅是多层级的,而且高阶的语义结构与人类的注意力分配高度契合。

打开网易新闻 查看精彩图片

Fig 1. 实验范式示意图:参与者在VR中自由探索复杂场景,研究者通过对场景进行密集的语义描述,提取出跨越视觉差异的抽象概念主题。

打开网易新闻 查看精彩图片

Fig 2. 堆叠回归模型框架:展示了如何将空间、视觉(ViT)和概念(LLM)三种特征空间结合,以量化各自对注视行为的独特解释力。
二、概念优先权是区分不同个体“注意力指纹”的关键

这篇研究最核心的发现之一,是概念特征在“区分个体”上展现出的压倒性优势。

研究者进行了一项“自我 vs. 他人”的模型对比测试:用参与者A在部分场景中的眼动数据训练出一个模型,去预测A在全新场景中的表现,并与用其他参与者数据训练出的模型进行对比。结果显示,基于空间特征的模型几乎无法区分个体;基于视觉特征的模型能产生一定的区分度;而基于概念特征(LLM)的模型则展现出了极强的个体特异性。每个人的注视行为都能被自己的概念模型最精准地预测。这表明,概念特征捕获了那些真正让你的视线区别于他人的独特结构。

打开网易新闻 查看精彩图片

Fig 3. 个体特异性预测结果:在概念特征空间中,利用个体自身数据训练的模型预测准确率远高于他人模型,证实了概念优先权的高度个人化特征。
三、概念对注意力的引导在场景探索中后期逐渐显现

如果概念知识是在帮助我们理解场景,那么它的作用时机应该有别于底层的视觉反射。通过对16秒的场景探索过程进行时间分辨分析,研究者发现了清晰的动态演变轨迹。

在观察的最初几秒,空间特征的预测力最强,反映了人们刚进入新环境时粗略的扫视习惯;紧接着,视觉特征的贡献开始上升;而到了第6到8秒之后,概念特征的预测力显著反超了空间和视觉特征。这种渐进式的增强表明,随着观察者不断积累场景信息,他们内在的概念优先权开始接管控制权,引导他们去寻找符合自身认知结构的深层信息。此外,这种基于概念的注视模式在跨越数天的两次独立测试中表现出了极高的重测信度,证明它是一种稳定的特质,而非暂时的状态。

打开网易新闻 查看精彩图片

Fig 4. 注意力优先权的时间演变与跨期稳定性:概念特征的预测优势在观察中后期才显著浮现,且个体专属的概念注视模式在不同测试日之间保持稳定。
四、越深层的概念推理,越能准确预测个体的注视轨迹

为了进一步证实LLM模型确实利用了“概念”而非仅仅是复杂的词汇,研究者对输入LLM的文本描述进行了分层截断实验。

他们将场景描述分为三个层级:第一层仅包含物体身份(如“一顶帽子”);第二层包含关系语境(如“戴在她头上的帽子”);第三层包含推理性或功能性信息(如“戴在她头上,可以用来遮挡阳光的帽子”)。结果显示,随着概念深度的增加,模型对个体注视轨迹的预测准确率也随之攀升,第三层级带来了最大的性能增益。这说明,真正吸引个体视线的,往往是物体背后的功能启示和深层语境,而不仅仅是物体本身。

打开网易新闻 查看精彩图片

Fig 5. 概念深度对预测准确率的影响:包含推理性信息的第三层级描述能最有效地提升个体注视行为的预测精度。

打开网易新闻 查看精彩图片

Fig 6. 个体概念优先权的可视化:通过t-SNE降维,可以看到被某一个体独特关注的场景区域,往往在概念空间中聚类(如都与“书写”或“室内装饰”相关),即便它们在视觉上截然不同。

研究意义

这项工作在多个层面上推进了我们对视觉注意力的理解。

首先,在理论层面上,它打破了传统视觉注意力研究中过度依赖视觉特征的局限,证明了自然语言模型的词嵌入空间可以作为人类概念组织的有效代理。这为“主动感知”理论提供了强有力的行为学证据:我们在看世界时,始终在用内在的世界知识进行假设检验和信息采样。

其次,在临床与应用启发上,这种稳定的“注意力指纹”为理解认知差异提供了新视角。例如,自闭症谱系障碍群体在自然场景中表现出的非典型注视模式,可能不仅仅是因为“不爱看脸”等视觉偏好差异,其冰山之下可能隐藏着更广泛的概念优先权差异。

最后,这项研究也明确指出了其应用边界与潜在风险。虽然眼动轨迹揭示了概念偏好,但它并不能直接等同于个人的价值观或信仰。然而,随着VR/AR设备中眼动追踪技术的普及,我们的视线数据确实能够暴露出高度个人化的认知特质,这无疑为未来的空间计算设备提出了更为严峻的数据隐私挑战。

分享人:饭鸽儿

审核:PsyBrain 脑心前沿编辑部

你好,这里是「PsyBrain 脑心前沿

专注追踪全球认知神经科学的最尖端突破

视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

每日速递「深度解读」与「前沿快讯

科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

点击卡片进群,欢迎你的到来

一键关注,点亮星标 ⭐ 前沿不走丢!

打开网易新闻 查看精彩图片

一键分享,让更多人了解前沿