多模态大模型、世界模型与具身模型正不断重塑 AI 能力的边界,但一个更基础的问题却长期被忽略:开放世界中的视觉退化。高速运动模糊、频率混叠、强光过曝、闪烁干扰… 这些现实环境中的复杂退化现象,会造成图像结构失真、信息缺失。而由于缺乏可靠真值,这类数据很难用于传统监督学习,往往成为 AI 训练中的盲区。因此,即便拥有强大的模型,AI 系统仍可能因为错误或缺失的视觉信息而做出错误判断。如何在有限硬件资源下获取高质量视觉信息,为机器人和具身智能提供可靠感知基础,已成为 Physical AI 发展的关键问题。

打开网易新闻 查看精彩图片

继《Nature》封面后,天眸芯相关工作又登《Nature Sensors》封面 —— “Seeing through visual primitives”

2024 年,清华大学类脑计算研究中心团队研发的 “天眸芯” 登上《Nature》封面,首次提出基于视觉原语(Visual Primitives)的类脑互补视觉感知新范式,并研制出全球首款基于原语的双通路互补视觉感知芯片 “天眸芯”,为机器视觉提供了一条区别于传统 RGB 成像的新技术方案。

时隔两年,团队在这一方向上的最新进展又登上《Nature Sensors》封面。

如果说 2024 年的工作完成了互补视觉从 0 到 1 的感知范式和芯片硬件创新,那么此次研究则实现了从 “1 到 10” 的系统级算法软件生态飞跃。研究借鉴人类视觉原语的自监督表征构建与内部模型(Internal Model)形成机制,将互补视觉扩展为一个可学习、可迁移、可 Scaling up 的完整技术体系。具体而言,研究建立了基于天眸数据构造视觉原语的方法,并提出了无需真值标注的退化数据自监督表征学习框架,使模型能够直接从真实退化数据中学习有效视觉表示,再高效迁移到不同下游视觉任务。同时,团队还开源了配套算法软件工具链 TianMouCV,为互补视觉算法研究、应用开发以及社区生态建设提供了统一的平台。

论文通讯作者为清华大学精密仪器系施路平教授与赵蓉教授;共同第一作者为原清华 “天眸芯” 算法负责人、现厦门大学智能制造学院助理教授林逸晗博士(兼晰见科技首席科学顾问)与清华大学博士生陈雨过。此外,2024 年《Nature》封面文章第一作者、现晰见科技 CTO 王韬毅博士,以及博士生孟亚鹏、陈相儒等核心成员也为本工作做出了重要贡献。

截至目前,中国大陆机构作为第一完成单位、在 AI 与芯片领域斩获《Nature》正刊封面的标志性成果仅有三项 ——“天机芯”、“天眸芯” 与 DeepSeek-R1。其中,清华大学类脑计算研究中心完成了前两项。从 “天机芯” 开创异构融合类脑计算芯片,到 “天眸芯” 提出互补视觉新范式,再到今天持续完善互补视觉的算法、软件与开源生态,团队始终坚持从第一性原理出发,探索新型智能计算与感知体系。这条持续十余年的原创技术路线,正不断推动类脑互补视觉走向 Physical AI 的真实应用,为下一代智能系统构建更可靠的感知基础。

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

互补视觉传感下的自监督视觉重建:高速高动态范围成像实例,以低带宽、低硬件开销达成高性能机器视觉

从 0 到 1:从感知入口应对视觉退化

2024 年《Nature》封面工作借鉴人类视觉机制,提出基于原语的互补类脑视觉感知新范式。将开放世界的视觉信息拆解为视觉原语的信息表示,并通过有机组合这些原语,借鉴人类视觉系统的核心机制,形成 “认知通路” 与 “运动通路” 两条优势互补、信息完备的视觉感知通路,使得智能系统既能够实现高精度的识别又能对运动做出快速响应。基于这一新范式,团队进一步研制出了世界首款类脑互补视觉芯片 “天眸芯”,该芯片将光信号分解为三类互补的数据模态:认知导向通路(COP)保留完整 RGB 信息,动作导向通路(AOP)捕捉高精度 ±7bit、动态范围 130dB、高速稀疏信息,包括空间差分(SD)和时间差分(TD)。不同通路对视觉退化的响应各异:RGB 保留颜色与外观,但易受运动模糊和过曝影响;空间差分保留边缘,却缺少运动特征;时间差分对变化高度敏感,但也可能将闪烁误判为位移。多种视觉原语互为补充,使 AI 系统同时获得颜色、结构和变化证据,在不同退化之间形成有效互补。芯片最终测得极高的性能指标和极佳的实拍效果,成为视觉感知新范式探索的重要起点。

从 1 到 10:让 AI 在退化信息中知道 “该信谁”

多路感知只是起点。开放世界中,视觉退化常常叠加,各路信号受损程度也不同。真正困难的是,在无法获得视觉真值和语义真值监督的条件下,当不同视觉通路提供的证据冲突时,处理算法能否判断可信度,并形成可泛化的内部视觉模型来形成优质的视觉表示。2026 年《Nature Sensors》论文借鉴人脑依托视觉原语实现稳健感知的内在机理,构建两阶段类脑感知学习范式,依托互补视觉线索自监督构建内部模型;基于天眸芯采集的极端场景实测数据集完成验证,成功突破传统视觉系统在开放世界极端成像退化条件下的感知瓶颈。

打开网易新闻 查看精彩图片

本文提出的类脑视觉传感 - 感知自监督学习框架:自底而上构建内部模型,自顶而下调制感知任务,基于天眸芯实现开放世界数据高效的鲁棒视觉感知

自底而上的阶段,算法不依赖现实中不存在的 “完美图像”,而是借鉴人与生俱来的视觉原语,将不同视觉先验嵌入一组中间表征,使其各自具有不同的优势,进而让不完整的证据彼此预测、校验。针对不同视觉退化,积分表征适应光照变化,运动补偿表征恢复瞬时结构,高动态范围表征补回过曝或欠曝区域。基于这些表征,本文进一步通过在时间上的对称自监督预测学习获得了一个内部模型,IGFNet。它利用跨通路注意力和记忆模块分配权重,保留可靠线索并推断缺失结构,最终在隐空间中形成通用的视觉表示,并可解码出视觉真值的估计(e-VGT):为 AI 构建尽可能完整、清晰、高动态范围且时空对齐的表征。

打开网易新闻 查看精彩图片

IGFNet 在闪烁干扰、过曝、运动模糊及混合视觉退化下生成估计视觉真值序列

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

更多极端场景下的实拍数据的通用视觉真值估计

从 “看清” 到 “看懂”:把感知能力送入任务

自上而下阶段把内部模型的视觉知识送入高层任务。一条路径以 e-VGT 作为 “新画布”,帮助基础模型生成语义标注;另一条迁移 IGFNet 内部形成的鲁棒特征,让下游网络继承应对视觉退化的能力。AI 获得的不只是一张清晰图像,而是可用于深度、分割和定位的感知基础。

在单目深度估计中,团队以实拍数据的 e-VGT 配合大模型标注,建立在极端环境下有良好单目深度标注的 Tianmouc-MDE 数据集,并将预训练的 IGFNet 编码器接入深度网络。即使图像受到曝光变化等视觉退化影响,深度结构仍能保持连续。

打开网易新闻 查看精彩图片

估计的视觉真值与内部模型 IGFNet 提供的视觉特征能大幅增强对开放世界极端环境下的单目深度估计能力

在视频实例分割中,团队以类似方式构建 Tianmouc-VIS 数据集并设计 YOLO-CVS。配合模拟数据习得基本的检测和分割能力,尽管 Tianmouc-VIS 的规模不大,但这类基于 e-VGT 生成的真实标注在多个模型的训练验证下都显著提升了极端环境下的检测和实例分割表现。这也提供了另一种利用天眸数据的方式。

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

依托本文提出的算法框架,团队攻克了极端图像退化条件下的视频实例分割难题,在自动驾驶感知、工业缺陷动态检测、低空无人机成像等场景具备极高的落地应用潜力。

生态矩阵重塑视觉:多篇相关成果发表于国际顶会

这篇《Nature Sensors》提供了一套完整的基于视觉原语的学习理论和应用范式,还正式发布了服务天眸芯的 TianMouCV 算法软件库。目前,TianMouCV 已经服务了多篇顶会顶刊的发表,逐步形成了围绕天眸芯的算法应用生态群。这里也一并展示一些出色的工作和应用典例:

手机影像中的视觉退化,常由夜景长曝光、快速主体和复杂运动共同造成。天眸芯可在一次 RGB 曝光内同步记录空间差分和时间差分,保留结构与运动证据。CVPR 2026 工作 STGDNet 在超过 100 类真实场景中验证:天眸芯通过记录曝光过程,实现无模糊成像。

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

基于天眸芯的双通路融合去模糊(Y Meng*, L Yang*,et al. CVPR 2026)

机器人场景中,强光过曝、快速转动等视觉退化会破坏特征跟踪。IROS 2025 工作 CSVO 以低帧率 RGB 和高速空间差分构建异步双通路视觉里程计,在曝光错误和快速视角变化中保持更稳定的轨迹,使 AI 在视觉退化发生时仍能持续感知自身与环境。

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

基于天眸芯的单目视觉里程计(Y Lin*, Z Zhang*,et al. IROS 2025)

结合视频扩散生成模型,天眸芯数据的可视化重建效果也登上了一个新的台阶。在 ICCV2025 中,团队依托基于数字光处理(DLP)的先进数据集构建方案,训练出级联双向循环扩散模型(CBRDM),该模型能够实现精准、清晰且色彩丰富的视频帧重建。

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

基于天眸芯与视频扩散生成的高质量高速无模糊视频重建算法(Y Meng*, Y Lin*,et al. ICCV 2025 )

在可穿戴设备与心理学领域中,互补视觉可用稀疏差分信号追踪快速、微小的眼球变化,大幅度降低算力与功耗需求,同时保留虹膜、眼睑和面部外观。能广泛应用于 AR/VR 及可穿戴设备领域。

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

基于天眸芯的眼动追踪

在深度估计任务中,互补视觉也可以充分利用成熟的传统视觉大模型能力,双通路互补特征能够被高效解码、融合与优化,精准还原场景真实深度分布,显著提升复杂动态场景下的深度估计精度与稳定性。该方案能够完美适配自动驾驶、室内导航、机器人避障等真实落地场景,有效解决了传统深度估计方法在极端视觉条件下可靠性不足的痛点。

https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g
打开网易新闻 查看精彩图片
https://mp.weixin.qq.com/s/GveYOwP2ZZikNH9IymQt4g

基于天眸芯的极端场景双通路融合的单目深度估计基础模型(X Chen,et al. ACMMM 2026, AC 推荐 oral)

从 10 到 100:重塑Physical AI时代的感知基础设施

从 2024 年 “天眸芯” 提出新的 AI 视觉感知范式,到如今《Nature Sensors》封面进一步构建从传感、自监督表征到系统认知的完整技术框架,清华团队围绕 “天眸芯” 持续完善了覆盖芯片、算法与软件生态的协同创新体系。这一路线不仅推动了互补视觉研究不断向前发展,也正逐步辐射全球相关领域的前沿探索。

作为清华大学类脑计算研究中心成果转化的核心平台,晰见科技全面承接并持续推进 “天眸芯” 类脑视觉技术的产业化应用。公司的核心创始团队 —— CEO 杨哲宇博士、CTO 王韬毅博士以及首席科学顾问林逸晗博士均师从施路平教授、赵蓉教授,长期参与国家类脑智能重大科研项目,曾作为核心成员参与两项登上 《Nature》封面的原创文章。公司研发团队中博士、硕士占比超 80%,核心成员平均拥有 10 至 20 年的图像传感器与芯片从业经验,曾服务于索尼(Sony)、英伟达(Nvidia)、安森美(Onsemi)等全球顶尖图像传感器与计算芯片巨头,以及国内一流 CIS 企业,形成了兼具前沿科研能力与产业工程经验的研发体系。

依托这一产学研协同团队,类脑互补视觉技术正在快速实现工程化落地。基于视觉原语 RGB+TD+SD 融合感知与双通路混合芯片架构,晰见科技实现了自适应视觉 Token 提取,在减少 90% 以上冗余视觉信息的同时,将多模态大模型与世界模型的首 token 延迟(TTFT)大幅降低 20 倍以上,Token 处理速度(TPS)提升 10 倍以上,并使模型训练成本降低一个数量级,为大模型视觉输入提供了更高效、更低成本的数据基础。

更重要的是,这不仅带来了性能指标的提升,更推动了视觉大模型输入范式的转变。长期以来,AI 视觉系统始终以 “帧 x 像素” 作为统一输入,将海量冗余像素送入模型,再依赖大规模算力完成信息筛选。而类脑互补视觉首次将视觉原语直接组织为稀疏、高信息密度的视觉 Token(Visual Tokens),使传感器输出天然与 Transformer 等大模型的 Token 表示相衔接,实现了从 "采集全部像素,再理解世界",向 "直接获取可理解的信息单元" 的范式跃迁。

这意味着,视觉传感器不再只是数据采集设备,而开始承担信息编码与语义组织的前端计算,成为大模型和世界模型的智能输入层。随着这一新型视觉输入范式不断成熟,晰见科技正推动类脑互补视觉在智能机器人、无人系统、AR/VR、智能制造等场景加速落地,为 Physical AI 构建面向开放世界、更高效、更鲁棒的新一代视觉基础设施。

Nature Sensors 论文:Brain-inspired Visual Sensing-Perception for Open-World Environments

TianmouCV 开源项目:
github.com/Tianmouc/tianmoucv