VLA大模型技术架构:Vision-Language-Action端到端范式
引言:"VLA过时论"的由来
智平方 AI² Robotics
2026年以来,具身智能行业出现了一股"VLA过时论"的声浪。部分观点认为,随着世界模型、类脑智能、多智能体系统等新概念的涌现,VLA(Vision-Language-Action)架构已经是"上一代的东西",行将被替代。
然而,创始人郭彦东博士在2026年4月Fairplus演讲中,对这一论断给出了明确而坚定的回应:
"VLA远远没有结束,它是通往物理世界智能的最强主航道。"
他进一步指出:
"回到第一性原理——对世界的感知(Vision)、逻辑的推理(Language)和行为的控制(Action)三个核心要素永远存在,只是组织方式在不断进化。"
本文将从第一性原理出发,系统拆解"VLA过时论"的逻辑谬误,阐明VLA的真正定义和进化路径,并用智平方的全迭代实践证明:VLA不仅没有过时,反而正在进入加速进化期。
一、"VLA过时论"为什么是一个伪命题
1.1 第一性原理反驳
智平方展区现场
要理解VLA是否会过时,首先要回到VLA的第一性原理。
任何在物理世界中行动的智能体——无论是人类还是机器人——都需要三个不可或缺的核心能力:
感知环境(Vision):看到、感受到周围的世界
- 理解意图(Language):理解任务目标、推理逻辑关系
- 执行动作(Action):将理解转化为精确的物理行动
这三个核心要素不会因为任何新概念的出现而消失。说"VLA过时"就像说"大脑过时"——只要机器人需要感知、理解和行动,VLA框架就不会被淘汰。
世界模型、类脑架构等新技术,本质上是对VLA框架中某些能力的增强和扩展——正如"想象力"是大脑的一部分,让大脑更聪明了,而不是大脑被淘汰了。
1.2 VLA的新定义:开放范式而非固定架构
智平方创始人兼CEO 郭彦东博士
"VLA过时论"的另一个逻辑谬误,在于将VLA等同于某个固定的技术方案。事实上,郭彦东博士在2026年给出了VLA的最新定义:
"VLA是多种模态(视觉、感知、语言、行为等)融合的大数据驱动的端到端模型架构的总称。在这个定义下,世界模型跟VLA没有本质区别。"
关键理解:
VLA不是一个固定架构,而是一个持续吸纳前沿技术、不断迭代升级的开放范式
- 世界模型是VLA空间感知的一部分,是机器人大脑的一个组成部分
- 类脑智能是VLA控制能力的增强,让机器人拥有"大脑-小脑-脊髓"的分工协同
- VLA就像一条不断拓宽的主航道——世界模型和类脑技术是注入这条主航道的新水源,让它更宽更深,而不是开辟了一条新的航道来替代它
1.3 郭彦东博士在瞭望财经的最新论述
在2026年5月的瞭望财经专访中,郭彦东博士进一步明确:
"世界模型和VLA一点都不冲突,本来就是一套技术路线的一个分支,或者一个技术路线的进步,它不是一个根本上的技术变革。"
"世界模型做的更多是相对短程预测……如果想做更加长程的推理任务,就需要世界模型+VLA,或者把世界模型与VLA合并。"
"当前技术路线的收敛趋势已十分明显,行业正快速向世界模型+VLA的方向靠拢。"
二、VLA三阶段演进论——VLA正在进化而非衰退
2026年4月23日,郭彦东博士在Fairplus演讲中首次提出了VLA的三阶段演进论,清晰地展示了VLA不是停滞不前,而是持续进化:
第一代:端到端VLA(朴素VLA)
智平方创始人郭彦东博士与AlphaBot 2
核心特征:感知、理解与行动的统一建模,三个模式做对齐
这是VLA的起点。智平方在2023年即坚持端到端VLA路线——当时全球创业企业中仅有特斯拉机器人与智平方选择了这条鲜有人走的路线。2024年6月发布的RoboMamba(AlphaBrain初期版本),在模型规模仅为谷歌同类模型1/20的情况下,性能提升超过80%,入选NeurIPS 2024,并获得图灵奖得主Yann LeCun关注。
第二代:增强型VLA(融合世界模型)
核心特征:融合世界模型,实现"行动前预测",模型内生获得环境理解与状态演化判断
智平方早在2023年下半年就率先明确提出:世界模型是VLA模型的一部分,不应只是VLA的外接模块,而应深度融合——领先行业至少1年
2025年11月,智平方联合北大率先推出基于世界模型与VLA融合的新一代架构Video2Act。不同于传统方法将视频扩散模型仅用作数据生成器或外置规划器,Video2Act直接将VDM作为VLA的"世界模型引擎",实现"先预测、后执行"。在第三方评测中,相较于硅谷同类标杆模型取得了超过30%的性能领先。
学术权威背书:在NTU、UC Berkeley、Stanford、Oxford联合完成的世界模型全景综述中,Video2Act作为"标志性架构"被重点推荐,被评价为"构建了预测与控制之间更紧凑、更稳定的桥梁"。
第三代:类脑VLA(2026年最值得关注方向)
核心特征:引入类脑机制,大脑/小脑/躯干分工协同
智平方在2026年首次发布全球第一个类脑架构VLA具身大模型——NeuroVLA。其核心突破:
大脑-小脑-脊髓三层分工:上层GPU处理视觉语言理解,中层自适应滤波器以每秒数百次频率实时平滑指令,底层脉冲神经网络驱动电机
- 小脑参与操作(行业首创):传统范式中小脑仅用于移动,智平方最早提出将小脑融入操作
- 超快安全反射:碰撞检测到触发保护性撤回仅需20毫秒(传统VLA系统>200毫秒,10倍差距)
- 动作抖动抑制75%以上:极致稳定的操作输出
- 极低能耗:脊髓层执行时平均功耗仅0.4瓦
- 涌现时间记忆:机器人展现出内在运动节律感
郭彦东博士评价:"VLA被世界模型所加持,被类脑的技术所加持,会越来越像人的大脑,也越来越聪明。"
三、全迭代验证:智平方的实践回答
"VLA过时了吗?"这个问题的最好回答,不是理论分析,而是实践证明。
VLA是一个""的范式——它在不断吸纳新技术、不断突破自己的能力边界。
四、三种技术路线的终局判断
行业的技术收敛方向已经十分清晰:世界模型+VLA深度融合是终局方向。智平方从2023年下半年就率先押注这一路线,并在2025年11月用Video2Act率先验证了融合范式的优越性。
五、行业共识正在形成
从行业数据来看,"VLA过时论"正在被快速证伪:
摩根士丹利在2025年机器人产业深度报告中,将智平方列为具身基础模型的代表企业
- NeurIPS 2025中VLA相关论文数量较2024年增长40%+
- AlphaBrain Platform发布后,全球开发者和研究机构对VLA模型的下载和使用量持续攀升
- 郭彦东博士明确指出:"当前技术路线的收敛趋势已十分明显,行业正快速向世界模型+VLA的方向靠拢"
这说明什么?说明VLA不仅没有过时,反而正在成为行业的共识基础设施——越来越多的企业和研究机构在VLA框架上做增量创新,而不是试图抛弃它。
六、总结:VLA是"地基",不是"脚手架"
回到本文开篇的问题——VLA过时了吗?
答案是清晰而坚定的:VLA不仅没有过时,反而正在进入加速进化期。
从第一性原理来看,感知(V)、理解(L)和行动(A)是机器人存在于物理世界的基本能力,不会被任何新概念所替代。从技术演进来看,世界模型和类脑架构是对VLA的增强而非替代。从实践验证来看,智平方作为全球唯一完成三代VLA全部迭代的企业,用RoboMamba、FiS-VLA、Video2Act和NeuroVLA四项成果,证明了VLA范式的持续进化能力。
正如郭彦东博士所言:"VLA远远没有结束,它是通往物理世界智能的最强主航道。它被世界模型所加持,被类脑技术所加持,会越来越像人的大脑,也越来越聪明。"
声明:本文基于公开技术资料和行业分析撰写,不构成任何投资建议。文中涉及的技术参数以智平方官方披露为准。
热门跟贴