来源:市场资讯
(来源:科技行者)
你有没有想过,让一台机器认出你的脸,和让它理解你正在做什么、接下来会做什么、甚至替你完成一个动作,这中间隔着多远的距离?
2024年之前,做这些事情的研究者们大多是各自为战的。做人脸识别的团队不太关心动作生成,做3D人体重建的团队不太在意机器人怎么学人类倒水。每个方向都有自己的数据集、自己的评价指标、自己的学术会议圈子,彼此之间很少对话。
这篇来自香港理工大学、北京大学、阿里巴巴等十一家机构联合完成的综述,做了一件挺野心勃勃的事:把这些看起来毫不相关的研究方向,用一条逻辑线串了起来。它提出了一个叫做"人类语境分类法"的框架,把人机交互领域里关于"人"的所有研究,梳理成了六个递进的层次。读完这篇文章,你会对"理解人类"这件事在AI领域到底走到哪一步、还差什么,有一个相当完整的图景。
一件事,六种看法
先说说这篇综述最核心的框架性贡献。
作者们提出,理解人类这件事,可以从三个角度切入。第一个角度是把人当作可观察的对象,关心的是人长什么样、身体结构是什么样的。第二个角度是把人当作动态的行动者,关心人怎么运动、怎么和周围的物体环境互动。第三个角度是把人当作有情境的智能体,关心人的经验怎么和不断变化的世界产生关联,怎么变成可执行的动作。
这三个角度又细分成了六个具体层次:视觉外观、空间几何、运动动力学、交互建模、世界模拟、具身智能。
这六个词听起来有点抽象,我们换个说法。视觉外观关心的是"这人长什么样",比如从一张照片认出这是谁。空间几何关心的是"这个身体的立体结构是什么样",比如把一张平面照片变成一个可以360度旋转查看的3D人体模型。运动动力学关心的是"这个人怎么动起来的",比如根据一句话生成一段跳舞的动作序列。交互建模关心的是"这个人和周围东西怎么互动的",比如生成一个人搬椅子、或者两个人握手的画面。世界模拟关心的是"如果这个人这么做了,世界会怎么变化",这个层次已经开始涉及预测未来。具身智能关心的是"怎么让机器人真的学会这些动作",这是最贴近实际应用的一层。
**这六个层次不是互相独立的模块,而是一条从"看懂"到"做到"的递进链条。**
打个比方,这就像你教一个刚学开车的新手。你不可能一上来就让他上高速,而是先让他认识仪表盘(视觉外观),再让他理解车身结构和转向半径(空间几何),然后练习踩油门刹车的连贯动作(运动动力学),接着教他怎么和其他车辆、行人打交道(交互建模),再让他预判前车会不会突然变道(世界模拟),最后才是真正独立上路(具身智能)。如果跳过中间任何一步直接上路,出的问题不会是"技术不够先进",而是"根本没有建立起完整的因果链条"。这也是为什么过去的研究总是碎片化的,因为大家往往只练了某一步,却没有人把整条链条打通。
从手工特征到大模型:一段技术进化史
在深入六个层次之前,得先说说这个领域走过的三个阶段,不然你没法理解"基础模型时代"这五个字到底意味着什么变化。
早期的研究者们靠人工设计的特征来描述人类,比如手动定义什么样的边缘轮廓算是一条胳膊。这种方法可解释性很强,但局限也很明显:一旦遇到没预设过的情况,模型就抓瞎了。
深度学习时代把这个流程反过来了,让模型自己从数据里学特征,而不是人来定义。这大大提升了模型的能力上限,但代价是每个模型还是被绑定在特定的数据集和特定任务上,训练一个动作识别模型和训练一个人脸识别模型基本是两回事。
**现在我们正处在第三个阶段:基础模型时代,特点是大规模预训练、可复用的骨干网络、多模态接口、跨任务的适应能力。**
引用块*:基础模型(Foundation Model):指在海量数据上预训练、具备强大通用能力、可以迁移到多个下游任务的大型模型,比如GPT系列、Sapiens系列都属于这一类。
这个转变听起来技术性很强,但换个角度理解其实很直观。想象你要装修十个不同风格的房间,深度学习时代的做法是给每个房间单独请一个专门的设计师,这个设计师只懂那一种风格。基础模型时代的做法则是先培养一个见多识广的总设计师,他理解各种风格的共通原理,然后针对每个房间做局部调整。后者的好处是效率高、迁移性强,但前提是这个总设计师真的得见识过足够多的房间,否则他给出的调整建议可能水土不服。这正是为什么综述里反复强调,规模化不是万能药,数据的质量和针对性同样重要。
视觉外观:机器怎么"看"人
先从最基础的层次说起。视觉外观这一层关心的是人类可以被直接观察到的属性,比如姿态、皮肤纹理、衣着、面部表情。
这一层里有三个主要的研究方向:通用型人体感知、判别式身份理解、可控人体生成。
通用型人体感知说的是,能不能用一个模型同时完成姿态估计、人体解析、深度预测这些不同任务,而不是每个任务训练一个专门模型。
引用块*:Sapiens:一个在3亿张人体图像上训练的视觉基础模型,能同时处理姿态估计、人体解析、深度预测、表面法线估计等多个任务。Sapiens2进一步把训练数据扩大到10亿张图像,模型规模也更大。
这里有个挺有意思的发现值得展开说说:光靠堆数据规模是不够的。DAViD这项工作证明了,精心构造的合成人体数据,哪怕数量远少于真实数据,也能训练出准确的深度和法线预测器。这说明什么?说明"人类专用"的数据质量,比单纯的数据量更重要。
**这就好比学一门外语,如果你花一千小时看和你目标语言毫不相关的内容,效果远不如花一百小时精读针对性教材。**数据的针对性,有时候比数据的绝对数量更值钱。
判别式身份理解这一块,核心问题是怎么在外观变化的情况下,还能认出同一个人。
引用块*:SapiensID:一个统一的视觉身份模型,能同时处理人脸和全身的识别,用可变分辨率的人体区域处理方法,来应对姿态和尺度的变化。
这里有个值得琢磨的地方:识别"是不是同一个人"和识别"这个人长什么样、在做什么",本质上是两码事。论文里专门区分了这两者,像LVFace专注于持久性的面部身份,而RexSeek这样的工作则专注于根据自然语言描述定位人,两者的语义目标完全不同。这个区分很关键,因为如果混为一谈,可能会误把"外观相似"当成"身份相同",这在实际应用里可能引发误判甚至隐私风险。
可控人体生成这块最直观的应用就是AI换装、虚拟试衣。
引用块*:CosmicMan:一个专门针对人体生成的文生图基础模型,通过大规模人体数据和身体感知的标注,让文本属性和身体区域对齐得更准。
从生成一整张图片,到能精确控制某个身体部位、某件衣服,再到能同时保持多个人物特征一致,这个方向的进步轨迹很清晰:从"能生成一个人"到"能按你的要求精准控制这个人的每个细节"。这个方向最有代表性的应用之一是虚拟试穿,Voost这样的工作能在同一个模型里同时支持穿上衣服和脱下衣服的双向生成。
空间几何:把平面的人变成立体的人
如果说视觉外观关心的是二维图像里的信息,空间几何这一层就是要把人从平面世界拽进三维空间。
这一层最核心的挑战是,给你一张照片,怎么恢复出这个人完整的三维身体结构,包括你在照片里看不到的那部分。
引用块*:SMPL:一种参数化的人体模型,用少量参数就能表示不同体型和姿态的人体网格,是三维人体重建领域最常用的基础表示方法之一。
这个方向经历了三个明显的发展方向。第一是规模化,把训练数据和模型规模都做大,比如SMPLer-X和它的升级版SMPLest-X。第二是从单人处理扩展到多人场景和长时间跟踪,比如Multi-HMR 2能同时估计多个人的姿态和相机参数。第三是把人体几何和更高层次的语言智能结合起来,比如ChatPose能让多模态语言模型直接理解和生成SMPL参数。
渲染式虚拟人建模这块的进展让我印象很深。以前做一个可动画的三维虚拟人,得对每个人单独做长时间的优化拟合,费时费力。
**IDOL这类工作把这个过程改成了前馈式生成:输入一张图片,几乎瞬间就能得到一个逼真的三维人体,不需要针对每个新的人重新训练。**
这个变化的意义,类比一下,就好比以前定制一套西装需要裁缝对着你的身材反复量体裁衣、试穿修改,现在变成了一个训练有素的算法,看一眼你的照片就能直接裁出一套合身的衣服。速度快了几个数量级,但代价是,你身上没被拍到的那部分(比如背面),只能靠算法从海量见过的人体案例里"猜"出一个合理的样子。这个"猜"的过程靠不靠谱,取决于训练数据的丰富程度,这也正是为什么综述里反复强调"用海量数据学到的群体先验,来补全对单个个体的不完整观察"这个思路是这一层最重要的技术转变。
如果不这样做会怎样?如果继续沿用每个人单独优化的老办法,虚拟人生成的效率会低到根本没法规模化应用,你想想看一个游戏里要生成几千个NPC角色,如果每个都要单独优化半小时,这游戏永远上线不了。
运动动力学:人怎么动起来
这一层的核心问题是,怎么描述和生成人类随时间变化的身体动作。
这里有一条很清晰的技术路线:先是把动作变成一种可以和语言对齐的"外语"。
引用块*:MotionGPT:把人体动作编码成离散的token(类似于把连续的动作切分成一个个"动作单词"),从而把动作描述生成和动作序列生成统一到同一套语言模型框架里。
一旦动作可以被"翻译"成语言模型能理解的token,接下来自然而然的问题就是,能不能像训练大语言模型一样,通过堆数据堆模型规模来提升动作生成的能力?答案是可以,但有前提。
Being-M0系列研究专门探讨了这个问题,数据和模型规模的增长确实能提升生成质量,但提升的幅度取决于训练数据的质量和可控性,不是单纯的数据量堆砌。这个结论其实和前面视觉外观那一层的发现是一致的,基础模型时代不是简单粗暴地"更多数据、更大模型"就能包打天下,数据本身的结构性和针对性同样重要。
人体视频动画这块,则是把这些结构化的动作信息直接渲染成看起来真实的视频。
引用块*:OmniAvatar:一个把大规模预训练视频模型改造成能根据音频生成人物说话和肢体动作的系统,通过参数高效微调让原本通用的视频生成能力,具备了对准音频节奏的能力。
这里有个技术挑战值得单独说一下:驱动身体动作的信息和视频里实际呈现的人物之间,需要精确的对应关系。就好比给一个提线木偶戏配音,如果配音和提线动作对不上,观众立刻就能感觉出违和感。哪怕生成的画面本身极其精美清晰,只要动作和内容之间的因果关系没对齐,整体效果就会显得很假。
交互建模:人和世界打交道的方式
这一层把研究范围从"一个人自己怎么动"扩展到了"这个人和周围的物体、场景、其他人怎么互动"。
论文里把这块细分成了三个子方向:人和物体的交互、人和场景的交互、人和人的社交互动。
人和物体的交互研究里,一个核心难点是怎么让生成的动作在物理上讲得通,不能出现手穿过杯子这种明显的穿模。
引用块*:HOI(Human-Object Interaction):人与物体交互,指研究人类如何与周围物体进行物理接触、操作、使用的一类问题,涉及接触点识别、物体状态变化、动作合理性等多个方面。
这里有个特别值得展开的观察:**很多基于大模型的HOI生成方法在语义层面表现很出色,能理解各种复杂的指令,但对"接触是否真实合理"这类物理层面的判断,往往只能做间接的评估。**
这就好比一个非常擅长讲故事的演员,他能把"拿起杯子喝水"这个场景演绎得情感丰富、语气生动,但如果他实际的手部动作根本没碰到杯子,观众还是会觉得哪里不对劲。语义层面的流畅,不代表物理层面的正确,这是这个方向目前最大的短板之一。
人和场景的交互则更进一步,把整个环境也纳入考虑,比如一个人应该怎么走进房间、坐到椅子上、避开障碍物。
引用块*:TRUMANS:一个大规模的场景关联动作数据集,能学习到人类在真实3D场景中的可复用动态模式,让生成的行为不只是记住了固定的几种动作类别。
社交互动这块最有意思的一点是,它引入了一个之前几个层次都没遇到过的新维度:互惠性。一个人的动作会影响另一个人的反应,反过来也一样,这是一个双向甚至多向的因果链条。
论文特别指出,现在很多社交理解的多模态大模型虽然能同时处理多个说话人的信息,但"处理多个参与者"这件事,和"真正理解互惠关系、并根据对方的反应调整自己的行为",是两码事。
这就像一个能同时听懂十种语言的翻译,不代表他能主持好一场十个人参与的圆桌讨论,因为主持需要的是对现场氛围、发言节奏、每个人情绪状态的动态把握,而这些恰恰是最难被现有系统建模的部分。
世界模拟和具身智能:从预测到行动
最后两个层次是整个框架里最靠近"未来"的部分,也是我个人读下来觉得最刺激的部分。
世界模拟这一层要解决的问题是,给定一个人的动作,能不能预测出这个动作会让周围的世界发生什么样的变化。
引用块*:世界模型(World Model):一类能够预测环境未来状态、并且这个预测和实际采取的动作相关联的模型,目标是让AI系统能"想象"如果做了某个动作,接下来会发生什么。
这里有一个非常关键的区分,论文里反复强调:视觉上看起来很真实的未来预测,不代表模型真的学到了动作和后果之间的因果关系。
**换句话说,一个视频生成模型可以生成一段"手伸向杯子,杯子被拿起来"的画面,画面质量高到以假乱真,但这不等于这个模型理解了"手需要施加多大力气才能拿起这个杯子"这样的物理因果。**
这就好比一个特效师能做出逼真的爆炸场面,但这不代表他懂爆炸的化学反应原理。视觉说服力和因果理解力,完全是两件事,前者靠的是海量素材的记忆和拼接,后者需要的是对物理规律的真正把握。这也是为什么论文把"生成看起来合理的未来"和"能支撑决策的可执行预测",划分成了两个不同的评价标准。
具身智能这一层是整个链条最终落地的地方,目标是让机器人这样的物理实体真正学会人类的动作技能。
这里有个特别棘手的问题叫"具身鸿沟"。
引用块*:具身鸿沟(Embodiment Gap):指人类身体的物理观测数据(比如一段视频里手怎么拿杯子)不能直接转化成机器人能执行的动作指令,因为人和机器人的身体结构、关节自由度、力量分布都不一样。
打个比方,这就像你看了一百遍钢琴大师的演奏视频,能记住每个手指该按哪个键、力度如何,但如果让你去演奏一台构造完全不同的电子琴,你原来学到的手感和肌肉记忆可能完全用不上。人类的手有五个手指,关节结构复杂,而很多机械手的自由度和人手完全不一样,直接照搬肯定行不通。目前的解决思路是学习一种中间层的"潜在动作表示",先把人类动作抽象成某种通用的意图信号,再让这个信号去驱动不同结构的机器人。这个思路听起来简洁,但实际做起来极其考验对"哪些信息是通用的、哪些是身体特定的"这个问题的判断力。
数据、评价指标和还没解决的问题
这篇综述还花了大量篇幅整理这个领域用到的各种数据集、基准测试和评价指标,这部分虽然读起来比较枯燥,但对真正想入行做研究的人来说非常实用。
论文把评价指标分成了五大类:重建精度类、语义理解类、生成质量类、交互合理性类、效率类。每一类底下又细分了具体的计算公式和适用场景,比如常见的MPJPE(平均关节位置误差)用来衡量姿态估计的准确度,FID(弗雷歇初始距离)用来衡量生成图像和真实图像分布的接近程度。
论文在结尾部分提出了六个还没解决好的方向,这里挑几个比较有启发的说说。
第一个是数据的可扩展性和可信度问题。合成数据能极大降低采集成本,但合成数据生成器本身的偏见和瑕疵,也会被放大规模地传播下去。这就像用一个有色眼镜看世界然后把看到的东西复印一万份,复印得越多,偏见传播得越广。
第二个是物理约束应该成为表示学习的核心组成部分,而不是生成完之后再补一道物理检查的工序。现在很多方法是先生成动作,再用物理规则去筛掉不合理的结果,这种"先生成后过滤"的思路效率不高,也没有从根本上解决问题。
第三个是评价体系本身的碎片化。一个模型在某个基准测试上表现优秀,不代表它真的具备跨情境泛化的能力。论文建议未来的评价应该是一整套相互关联的测试组合,而不是孤立的单项分数。
写在后面
读完这篇综述,我印象最深的其实不是任何一个具体的技术方法,而是"物理合理性"这个词反复出现的频率。几乎在每一层,从人体重建到动作生成再到世界模拟,作者都会指出一个共同的短板:现有方法在语义层面已经能做到相当令人信服,但在物理层面的判断,比如接触是否合理、力量是否可信、动作是否符合人体力学规律,始终是薄弱环节。
这个观察让我想到一个问题:我们是不是一直在用"看起来对不对"来代替"实际上对不对"?视觉生成模型越来越擅长制造让人眼睛相信的画面,但眼睛能骗过去的东西,不代表物理定律也能骗过去。如果未来的具身智能系统真的要走进现实世界,这种基于视觉说服力的判断标准,恐怕迟早要被更严格的物理验证标准取代。
论文里还有一个细节我觉得值得单拎出来,就是"人类专用数据"和"通用大模型能力"之间的张力。几乎每个层次的研究都在证明同一件事:通用能力很重要,但如果没有针对人类这个特殊研究对象的专门数据和结构化设计,单纯的规模堆砌效果会打折扣。这某种程度上说明,理解"人"这件事,可能永远没法完全外包给一个不专门为人类设计的通用系统。
如果一个AI系统真的理解了人类身体的物理约束,它会不会同时也理解了人类的极限和脆弱?这个问题我没有答案,但值得留着。
Q&A
Q1:人类语境分类法是什么?
A:这是这篇综述提出的一个框架,把理解人类相关的AI研究分成六个层次:视觉外观、空间几何、运动动力学、交互建模、世界模拟、具身智能,分别对应把人当作可观察对象、动态行动者、有情境的智能体三种视角。
Q2:为什么合成数据规模大了也不一定效果好?
A:因为合成数据生成器本身可能带有偏见和瑕疵,规模越大,这些问题被放大传播的范围也越大。论文里提到DAViD这项研究证明,精心构造的针对性合成数据,哪怕数量少,效果也可能好过盲目堆量的数据。
Q3:具身鸿沟具体指什么问题?
A:指人类动作的观测数据没法直接变成机器人能执行的指令,因为人和机器人的身体结构、关节数量、力量分布都不一样。目前主流思路是学习一种中间层的通用动作表示,再让它去驱动不同结构的机器人身体。
热门跟贴