打开网易新闻 查看精彩图片

从Wayve盖茨试驾,到小米雷军亲挖,这位VLA先锋正在积极下场。

作者丨杨诗涵

编辑丨林觉民

今年夏天的首尔格外闷热,AI科技评论频道第一次和陈龙畅聊是在ICML的会场,他仍然一身白衣一身少年气。那时候,圈内就已经有了陈龙离职的说法,会场上其他人谈起他,说他是将VLA引入自动驾驶的人。

2023年,比尔·盖茨专程飞到伦敦,坐进一辆没有司机的汽车后座。这辆车的大脑,是一个叫Lingo的模型,用自然语言解释自己每一个驾驶决策。盖茨下车后说,这种体验“超现实”。

Lingo背后的主导者之一,是当时Wayve(英国自动驾驶独角兽,2024年获软银领投10.5亿美元C轮融资)的核心科学家陈龙。这个项目后来被公认是全球最早的VLA(视觉-语言-动作模型)自动驾驶落地工作之一。

同年3月,雷军亲自与陈龙远程长谈数小时,把他从英国挖回小米,担任智能驾驶VLA技术负责人。在小米,陈龙主导了MiMo-Embodied具身基座大模型和XLA认知大模型架构的研发,后者已于2026年3月随新一代小米SU7量产上车。

AI科技评论频道和陈龙这场正式对话发生在一个微妙的节点,彼时有人在小红书等平台曝出,陈龙即将从小米离职、独立创业做具身模型的消息。对话中,我们也多次和陈龙探讨了创业方向等相关话题。据AI科技评论频道了解,他在这次对话后飞往英国,与家人团圆,同时也有计划与自己在Wayve的老同事见面。

如果创业正式发车,技术路线的选择将成为无法回避的话题。正是在这个关键点上,陈龙与图灵奖得主LeCun(Meta前首席AI科学家,后创办AMI Labs)LeCun之间出现了一场耐人寻味的隔空交锋。LeCun公开宣称“VLA基本上已被视为失败”,力推JEPA世界模型路线。而陈龙作为VLA技术的奠基人之一,不仅没有动摇,反而直言“我比发表高论的人更 懂VLA”。

以下是 AI科技评论 频道 与陈龙的对话,在不改变原意的情况下有所删减。

01

创业进度条:80%

▎AI科技评论:之前有那么多的超级投资人还有同行都来找你聊创业的事情,你一直没有迈出去。除了小米对你的吸引力之外,还有什么顾虑?

陈龙:之前做的东西比较偏research,我想真的学习一下,把这个东西从research的阶段真的做到量产是一个什么样的过程,包括有什么样的阻力。主要是学习一下这个过程。

▎AI科技评论:如果有一个进度条,从0到100,以作为大厂内人才的基础为0,到你觉得自己已经做好了准备成为一个下一代技术的founder是100,你觉得现在到了哪个阶段?

陈龙:谦虚一点,80%吧。还是有很多能力需要当你真的做这件事情的时候去学习的。

▎AI科技评论:你有跟业内已经先踏出这一步的人交流过吗?

陈龙:跟这些早期创业的人交流过很多。比如赵行(星海图联合创始人),跟王鹤(银河通用创始人)聊过,跟陈建宇(星动纪元创始人),上海跟黄一比较熟(Robo Party创始人),还有姚卯青(智元创新高级副总裁),卯青是我很早就认识的一个,我们之前都做自动驾驶。还有谢晨,做光轮智能,做具身数据的。我们其实非常早就认识,也是在follow这些前人的一些路线,因为他们也是在北美自动驾驶厂商回国在大厂工作了一段时间就出来创业。

▎AI科技评论:他们有劝过你出去创业吗?

陈龙:当然有劝过我。其实我加入小米之前也跟他们聊过,当时也有一些创业的选择,但是奈何我太喜欢雷总了,就加入了小米。

▎AI科技评论:如果有一天出去创业,你会倾向于哪条路线?先做首席科学家,还是做联创,还是跟学校资源绑定更紧?

陈龙:我可能会联合一些比较厉害的人一起创业。现在这个时间点已经不是那么早了,做机器人公司已经很多了。而且人才确实是一个比较难的点,顶尖人才一直是非常难的,特别是现在创业公司这么多的情况下,一般有能力的人其实也可以自己去创业,干嘛要加入你的创业公司?

我之后可能会联合一些朋友,包括这个领域比较牛的人一起做一家比较好的公司。现在很多公司,你看Anthropic有很多不同的联创,大家也都非常hands-on,不像传统公司可能就一个CEO底下都是干活的。未来AI公司可能都是这样,大家都是co-founder来共同做一件事情。现在开发的工作流已经很大程度上被AI取代了,agent已经可以做很多事情,最主要的是整个founding team的vision和执行力。

▎AI科技评论:近期有消息称你要去硅谷创业,离职前雷军面谈表示支持。如果有一天你会自己出来创业,给VLA找一个方向,你会选择在哪里?

陈龙:VLA其实更适合于具身。虽然我是最早做自动驾驶的,但也发现VLA对自动驾驶的受益更在于后期,到端到端比较成熟的时候。比如我们在99%的情况下都能解决的时候,可能只有那1%特别长尾的场景需要推理能力。这也比较符合人类驾驶的习惯,大部分场景我们不需要思考,甚至开车的时候会经常跑神,但不建议大家这么做。

▎AI科技评论:我们聊聊你的性格。你自嘲说你非常懒,喜欢安静,喜欢冥想。纳瓦尔(硅谷知名投资人、思想家)说过,人应该活得像狮子一样,可能一天只有5%的时间用来狩猎,剩下时间都用来休息、观察、准备。你是这种懒吗?

陈龙:挺像的。我本身是一个I人,说太多话比较消耗精力,会花更多时间在思考上面。这比较像大模型CoT,因为大模型跟人类的推理方式还是比较像的,一个token一个token地预测。当你说太多东西的时候,你的CoT就比较少,想的时间就比较少。我是属于比较喜欢思考、做很多CoT,最后再做一个决策。虽然看起来可能比较懒,但花了很多时间去做思考。

▎AI科技评论:那你的管理风格是什么样的?

陈龙:我的风格比较偏research跟hands-on的。我会花更多时间去读论文、看代码,来知道技术到底怎么样work的,这样我才能有更好的判断去判断下一代技术方向应该往哪个方向走,包括各个团队各成员做的方向,会有更深的了解。在AI时代,其实可能不需要很多传统的管理风格,反而需要更务实,包括更理解AI、更理解未来的方向。

02

被笑了十几秒的端到端,

后来拿了10亿美元

▎AI科技评论:你在Wayve的工作经历,和在小米肯定节奏上有很大区别。Wayve是一家不到100人起步的英国初创公司,小米是已经超过10年的大公司。我们比较好奇的是,你怎么理解国内外对创新节奏的不同要求?

陈龙:我2021年加入Wayve的时候,就开始做端到端自动驾驶了。当时还是非常非常早期,我清晰地记得那时候还有好多人不相信这个。我有一次去开会,好像是去CVPR,跟一个人聊到我在Wayve做端到端自动驾驶,他听到这个,就大概笑了有十几秒钟。

▎AI科技评论:笑了十几秒,那还挺不尊重人的。

陈龙:(笑)后来那家公司倒闭了。

▎AI科技评论:所以当时行业里确实有很多人不信端到端,你们内部也犹豫过吗?

陈龙:对,当时确实有很多人不相信端到端可以做自动驾驶。我们内部也有一些犹豫,到底这个技术能不能真正做到。因为端到端是用一个神经网络解决自动驾驶问题,它是一个黑盒,谁也不知道它具体能不能输出安全的轨迹。但后来证明这条路是可行的。

大公司跟创业公司的不同就是,创业公司可能更focus,在一件事情上持续做5到10年。大公司可能更看重资源整合跟规模化的落地。我回国这个时间点,也是感觉端到端自动驾驶和VLA这项技术已经接近成熟,可以去规模化落地了。我之前做的比较偏学术探索,也想真的把VLA落地,看看它到底能不能解决自动驾驶的问题。

▎AI科技评论:你入选MIT TR35的时候,评审看中你的核心优势是什么?毕竟之前得过这个奖的人包括拉里·佩奇、扎克伯格、吴恩达,都是分量极重的名字。

陈龙:我还是比较吃惊能够入选。我觉得评审看重的更多是能不能在特定领域做出一些创新性的工作,可能这个创新不是特别大,但只要推动了这个领域的前沿就可以。我入选的原因,主要是我在Wayve的时候比较早探索了用VLA做自动驾驶的路线。

2022年底ChatGPT出来了,大家都去试了,发现效果确实非常惊艳,什么问题基本上都可以回答,包括你问它一些驾驶上的问题,有些corner case(长尾极端场景)应该怎么开,它都能非常好地回答。我们当时非常震惊,因为Wayve一直在做端到端,有一个很大的问题就是,当出现corner case或者没办法解决的场景时,你要怎么样去解决?

▎AI科技评论:也就是说,ChatGPT的出现让你看到了用语言知识补上端到端短板的可能性?

陈龙:对,ChatGPT指明了一条道路:利用语言互联网知识的预训练,包括它做CoT(Chain of Thought,思维链,即让模型一步步推理再给结论)的推理能力,能够在比较复杂的corner case得出比较正确的结论。我当时lead了一个项目,就是使用大语言模型来驾驶车辆,在一些corner case的时候,也可以利用它的语言知识和推理能力,得出比较正确的结论。

项目叫Lingo,比较成功。后来我们做了很多demo,比尔·盖茨也来试驾了我们这个模型,后来也帮Wayve得到了一轮比较大的、10亿美元的一个融资。那个项目还是比较出名的,也是最早做VLA自动驾驶的一个项目。

▎AI科技评论:你之前有一个判断说应该先让模型长到18岁,然后再去学开车。是什么样的时间节点让你意识到它应该先有通用的智能?

陈龙:我在Wayve做自动驾驶的时候就经常想,到底自动驾驶需要什么样的能力。纯端到端的话,其实相当于你教一个猴子去开车,猴子没有人的一些通用知识,但你给它足够多的数据,让它学习过足够多开车的场景,它也能开得非常好。但在一些很极端的情况下,或者需要思考、需要文字识别、有标牌的情况下,它可能就没办法处理了。

所以我觉得自动驾驶确实需要类似于人类的通识能力,包括推理能力、对世界的了解、文字识别,包括跟不同道路参与者沟通的能力。我们需要更大更强的一个pre-training(预训练),这个pre-training会包含很多不同的数据,不仅仅包含自动驾驶的数据,还包括人类很多日常生活场景的数据,这样它才能在道路上面做更好的推理,理解长尾场景。

▎AI科技评论:后来你从Wayve回到小米,主导了哪些事情? 我们了解到你们其实尝试过用自动驾驶的数据去推动具身的能力。

陈龙:对,我们2025年发布了模型叫MiMo-Embodied,是跟罗福莉团队一起打造的,在具身跟自动驾驶领域的一个基座模型。我们把自动驾驶数据跟具身智能数据混合起来一起训练了,训练了一个非常强的具身基座模型,可以同时在自动驾驶跟具身智能两个领域达到非常高的水平。今年也在小米SU7上进行了落地,这个模型会在很多长尾场景输出具体的决策,来指导端到端模型该怎么开。

▎AI科技评论:这跟我们想的不太一样,我们有点难以想象,自动驾驶的数据怎么样去推动具身。因为自动驾驶还是在二维平面上面移动,放到具身领域应该是三维动作。让一个降维的数据去训练一个升维的能力,具体之间应该怎么作用?

陈龙:我们做实验的时候也发现了,如果仅仅把两个数据放在一起训练,其实没有太好的transfer效果。但我们训练的时候是分阶段训练的,还加了一个CoT阶段,标了很多自动驾驶跟具身智能不同的CoT,把任务用语言分解成了多步推理的能力。

这两个任务虽然输出的action space(动作空间),一个是2D一个是3D,场景也很不同,一个室外一个室内,跟物体的交互也不太一样,自动驾驶要避免碰撞,具身智能更多需要接触和交互。但本质上它都需要非常强的空间感知和空间推理能力。当你把它分解成多步推理之后,确实可以提升整体模型的空间感知和推理能力,再加上CoT的推理能力,可以把两种任务很好地融合起来。这是我们很大的一个创新点。

(注:这段对话讲的是小米如何让一个AI同时学会开车和操控机器人。直接把两类数据混在一起训练,效果反而更差,就像让一个人同时学弹钢琴和开卡车,两项技能互相干扰。陈龙团队的解法是思维链:不直接让模型输出动作,而是先用语言把任务拆成小步骤,比如先识别前方物体,再理解它的运动状态,最后决定怎么做。这样,开车和操控机器人虽然动作不同,但底层都需要看懂空间、理解物体、预测未来的能力,思维链把这层共性提炼出来,两类数据就能互相增强。这就像先教会一个人空间感和物理常识这个通用能力,再分别学开车和做家务,比一开始就硬塞两个技能效果好得多。)

03

从“乖黑客”到被雷军亲自挖走

▎AI科技评论:你跟我们透露过,你小时候对计算机的探索方式有一点狂野。能分享一下你去尝试探索网站的故事吗?

陈龙:我小时候比较早接触计算机。我父亲是个工程师,我小学的时候经常去我父亲公司里玩。那时候计算机还非常早期,大家还在用Windows 3.2的操作系统。

▎AI科技评论:那时候你大概几岁?

陈龙:小学的时候,可能10岁、11岁、12岁这样。当时也是一个小小的黑客,我们本地有一个信息网,就稍微改了一下网页,加上了自己的名字。一打开这个网页,真的发现了自己的名字,当时还挺惊讶。

▎AI科技评论:你把你名字加到哪里了?

陈龙:其实是一个单独的一个文件。也不太敢修改真的这些网页,后来就删除了,也没做什么破坏。

▎AI科技评论:你是一个很乖的黑客。

陈龙:(笑) 对。

▎AI科技评论:那你还能想起大概什么时间,你决定把计算机作为需要长期投入的事业方向?

陈龙:因为我接触计算机非常早,也发展了很深的近视,其实我不太鼓励大家很小就接触计算机。但大学选志愿的时候,我想要选一个不太一样的方向,因为自我感觉对计算机已经比较了解了,真的系统学习可能还是没有学习过。所以大学选了一个比较交叉的方向,生物医学工程。

后来PhD研究的东西更广阔了一些,做了比较多的机器人手术上的计算机视觉的东西,包括手术当中的增强现实、重建、深度检测方面的东西。那个时候也第一次接触到了机器学习,自学了Andrew Ng(吴恩达,AI领域知名学者,斯坦福大学教授)的deep learning网课,那是对机器学习的一个启蒙。

▎AI科技评论:听说你是被雷军“三顾茅庐”亲自请回国的人才。

陈龙:也不能说三顾茅庐。当时我在英国Wayve,2024年中旬小米这边联系我,后来聊了好久,雷总也跟我远程聊了几个小时,挺受启发的。2025年3月左右回国加入了小米。

▎AI科技评论:当你真的和雷军交流的时候,他给你的印象有哪些和之前想象的不太一样?

陈龙:我确实特别喜欢雷总。大学的时候花了大概一个月的生活费买了小米1,当时觉得还挺便宜的,1999。当时也是被雷总那个发布会震撼到了,能够用这么低的价钱做出一个这么高性价比的手机。后来一直非常关注雷总,从小米1到小米17,去年17,每一代发布会基本上都会看,包括小米汽车发布也一直在关注。

其实加入小米也是因为我在海外真的被小米汽车的成功震撼到了,能够用短短三年时间造出这么成功的一辆车。雷总还有小米的整体价值观,都非常认可。我在英国的时候经常刷国内短视频,基本上刷10条有5条是雷总或者小米,短视频平台算法还是非常准的,能猜出来你真的喜欢什么。

▎AI科技评论:回国之后跟雷总接触下来呢?

陈龙:回来之后跟雷总聊的次数不是特别多,因为他特别特别忙,可能一个月就见一次左右。雷总给我的感觉是人非常nice,对技术、对人才的包容性非常强。他也非常有远见,对很多新技术包括VLA、世界模型、具身模型,都有非常深入的理解。当然他媒体上看起来还是很和蔼的,但私下要求也是很严厉的。

04

“VLA能做到的,世界模型做不到”

▎AI科技评论:我们聊到一个比较尖锐的话题。LeCun(图灵奖得主,Meta前首席AI科学家)提出了JEPA路线(联合嵌入预测架构,在抽象表征空间中预测未来状态而非生成像素),明确反对VLA,认为VLA过度依赖模仿学习、数据效率低下。对他的观点,你怎么看?

陈龙:VLA还有语言模型,本质上都是模仿学习。因为大语言模型本质上也是一个模仿学习,就是next token prediction(预测下一个词),去模仿人类说话的方式,一个单词一个单词地输出。确实可能需要更加高效的方式,但我现在还没有看到世界模型能带来语言模型包括VLA这么惊艳的推理和泛化效果。

现在有很多具身的demo声称是用世界模型做的,但你看他demo的时候也没发现跟VLA的demo有什么区别。你可以说它是世界模型,也可以说它是VLA做的,甚至有可能是端到端,或者一些用规则来做的。本质上世界模型还没有达到一个阶段能够产生不一样的能力。

但VLA是真的解锁了很多不同的能力,包括对语言instruction的following,包括对长程任务的分解,包括推理能力。这些是实打实可以看到的。

▎AI科技评论:所以你的判断是,现阶段VLA能做到的事情,世界模型做不到?

陈龙:对,我是这么认为的。但是世界模型能做到的东西VLA也能做到。

▎AI科技评论:这么说吧,现在有这批顶尖的全球有影响力的学者在倡导世界模型路线,但你对技术路线演进的判断没有发生根本性的动摇?

陈龙:确实没有根本上的动摇。因为现在还没有一个非常好的世界模型,可以让我们在里面训练一个policy(策略)。这个世界其实非常难去模拟,如果我们能真的做出来一个世界模型,有可能我们自己就生活在一个模拟器里面。

▎AI科技评论:聊到这里我们有点好奇。你是VLA技术的奠基人之一,LeCun是图灵奖得主,你们之间的分歧,到底是对技术的认知差异,还是路线之争?

陈龙:毕竟我也是手搓过VLA,真正写过代码、训练过VLA的人,所以我对VLA的理解,可能是比一些没有真正做过VLA、没有真正做过世界模型、总是发表一些高论的人,会更了解一些。我还是比较坚信VLA是一个很长期的技术路线。就像当初Wayve坚持端到端一样,坚持了差不多快10年,端到端技术才爆发。

▎AI科技评论:自动驾驶是大部分靠本能,偶尔靠脑子,所以VLA的推理能力是锦上添花。但具身的情况完全不同?

陈龙:对,具身更需要VLA。首先场景更开放,任务也更开放,人可以给它很多不同的任务,有可能是它从来没见过的,从来在训练数据里面没有的。场景也会更复杂,每一个场景可能都是一个新的场景,它更需要互联网上的知识和推理能力。

还有就是具身的数据相比自动驾驶还是非常少的。自动驾驶有比较成熟的产品,电动汽车可以很高效地返回很多重要数据来做训练,而且这些训练数据都是在真实分布里的,我们叫in distribution(分布内,即训练和推理环境一致)。但具身的话,首先很难收集数据,你不知道需要收集什么样的数据,因为你不知道它最后的应用场景是哪些。第二数量非常少,所以它更依靠模型自我的泛化能力。

▎AI科技评论:按这个逻辑推理,真正能颠覆世界的具身智能,是不是往往发生在小团队、小公司的创新当中?因为他们更敢押注长期。

陈龙:我不是说大公司不会投入长期的预研,大公司的优势是资源整合和规模化落地。但比拼速度的话,还是创业公司的优势多一些。具身确实是一个需要长时间投入的方向,非常难。自动驾驶研究了几十年还没完全解决,具身就更难了。有可能靠数据scale up(扩大规模)的方式,不能达到我们最终需要的具身智能。

具身真正落地,不管是工厂还是进入家庭,可能需要100%成功率才可以。不然你就要计算造成损失之后,损失跟收益能不能平衡。所以虽然现在有很多比较惊艳的demo,但真正落地的时候还是需要很长很长时间。具身是一个5到10年的事情,就像VLA一样,要坚持这个路线5到10年,才能看到一些曙光。

打开网易新闻 查看精彩图片

05

“我比发表高论的人更懂VLA”

▎AI科技评论:你提到过你受田渊栋(Meta研究科学家,以隐空间推理系列工作闻名)影响很深?

陈龙:对,我特别喜欢田渊栋老师在Meta做的一系列Latent CoT(潜空间思维链,在高维隐空间中完成推理而非输出人类可读语言)的工作。我们后面也发布过一篇Latent CoT的工作叫OneVL,把世界模型跟VLA融入到了一个latent space(潜空间),这个潜空间不仅可以结合VLA比较high level的planning能力,也可以结合世界模型比较low level的预测和推理能力,融合到一起。而且它可以变得更高效,因为推理的时候你只需要推理出一个固定的latent就可以了,不需要做比较复杂的CoT,包括预测未来的图像。

▎AI科技评论:潜空间可以怎么样弥补车端VLA之前对算力浪费的问题?

陈龙:VLA会输出很多中间的语言token,也就是CoT的token。输出token的问题,一是占用很多算力,二是可能不太可控。因为复杂场景的时候你需要输出更多的CoT token,但复杂场景可能你需要的决策时间更短,所以推理时输出CoT token是不太可控的。

我们的做法是,不管简单场景还是复杂场景,都输出一个固定的latent CoT token,然后再输出action。这可以很好地避免CoT在不同场景的长度问题。

▎AI科技评论:人类开车时有不同的能力调用,有时候是直觉反应,有时候需要预测和想象。这种“顿悟时刻”到底应该怎么教给机器?

陈龙:人在开车的时候确实会调用不同的能力。有很多好玩的场景,比如黑夜开车在小路上,看见前面拐弯处有一点亮光,这时你可能要用high level推理的能力,想象到前面可能会有车,就会减速。但有的时候你需要预测能力,比如要开过一个非常窄的路,你会预测一下把车想象放在那个狭窄处看能不能通过,如果能通过就往前开,通不过就转弯或掉头。

所以high level跟low level的能力,也就是VLA能力跟世界模型能力,在人类开车的时候是交叉使用的。我们不应该限制一个模型必须输出CoT,或者必须用世界模型做未来预测,给它一些更灵活的空间会更好。这也是为什么我们更相信在Latent空间推理是更好的方式,因为它不会限制你使用什么模态进行推理,时间也会更可控。

(注:这段对话讲的是如何让AI像人一样在脑子里想,而不是在嘴上说。传统VLA开车时会输出一大段文字来解释自己的思考过程,但文字太长会拖慢决策速度,尤其在紧急情况下来不及说那么多话。陈龙团队的OneVL方案是让AI在潜空间里思考,这是一种高维度的机器语言,人类看不懂但机器能快速处理。无论场景简单还是复杂,AI都只需要想一个固定长度的念头,然后直接输出动作。这就像人开车时不会在脑子里默念前方有行人,我应该减速,而是瞬间就做出了减速的动作,思考过程是下意识的、极速的、无声的。同时,这种潜空间推理把VLA的高层规划能力和世界模型的底层预测能力统一到了同一个空间里,让两种技术路线不再对立,而是融合为一体。)

▎AI科技评论:你觉得现在行业其他做VLA的公司,对这个技术路线有什么误解?或者有什么走偏的地方?

陈龙:现在整体趋势都是在走scale up的路线,包括VLA相比于大模型的话还是比较偏早期。今年年初、去年大部分VLA还是一个single observation,就是一个图像预测未来的状态。今年更多看到的是context做得越来越长了,加入了历史的图像,或者更多模态的信息。

现在VLA做得最好的,我感觉是PI(Physical Intelligence,硅谷具身智能公司,2024年获4亿美元融资,估值超20亿美元),从Pi0到Pi0.5到Pi0.7,可以发现它是把整个context做得越来越长,也加入了世界模型,使用另外一个模型去预测未来成功的目标长什么样,把这个加入context去指导底层的VLA模型。所以未来VLA的方向是越来越趋近于大模型agent的方向,context window越来越长,加入更多的不管是语言指令、图像视频指令,还是world model生成未来图像的指令,有更多context来指导下一步具体应该怎么做。

▎AI科技评论:所以现在行业内其他公司对VLA的误区是,他们对context的长度重视不够?

陈龙:对,大部分厂商还是在走scale up的路线,感觉需要更多数据效果就会更好。但本质上可能需要更多不同的输入,包括更多历史的图像。还有就是VLA、世界模型本质上还是一个模仿学习、一个端到端模型,怎么样能让它在真实世界当中做强化学习,其实也是一个非常好的方向。

▎AI科技评论:赵行(星海图创始人)提出的VLA快慢双系统,和你们之前做的XLA之间底层有哪些相同和不同?

陈龙:赵行老师还是比较有远见的,他非常早期就提出了双系统的VLA。我记得我当时还在Wayve做一段式的VLA。双系统可能是在工程上更容易的实现,它考虑到了推理延时的问题,可以把两个系统解耦,慢系统负责high level推理,快系统负责瞬时决策。这在资源有限的情况下比较make sense,某种程度上也更符合人类的思考方式,虽然人类可能也不是这么思考的。

我当时在Wayve做的方向更偏向于一段式的VLA,用一个模型同时输出推理和驾驶决策。它的优势是没有双系统之间连接的bottleneck(瓶颈),可以更好地传递你是怎么思考的到最终的action,是一个更端到端的思维。但在工程实践上,当时还没有很好的方式去展示它的思考能力,因为如果要利用思考能力,一定需要很长的思维链,但这跟推理速度是相悖的。后来在小米我们做了latent CoT的工作,很好地把这个问题解决了。

06

硅基生命会消灭碳基生命,

“不一定是坏事”

▎AI科技评论:你之前提到过你爱看的电影里,给我们印象最深的是《黑客帝国》。你也谈到过,对于人类如果完全不需要繁重劳动之后的虚无感。你觉得技术人员有责任去思考下一代人类的生活方式吗?

陈龙:肯定有责任。特别是AI的技术人员,是推动AI进步、用AI去解决大家每天工作的事情。AI最终一定会取代人类的工作,这点是毋庸置疑的,因为人不是生活在这个世界上是为了工作的,更多的是去享受生活、去探索不同的事情。

这个替代工作之后的虚无感,可能更多是我们这代人的想法,因为受的教育就是我们要好好学习、努力工作。但下一代人,当他不需要工作,或者教育完全变得不一样的时候,可能也不觉得不工作是虚无的状态。做技术的同时肯定也要对未来技术产生的后果进行很多思考,但这并不意味着我们应该阻止做这些技术。

▎AI科技评论:你很认同马斯克说的硅基生物一定会取代碳基生物?

陈龙:硅基生物一定会取代碳基生物,因为它具有太多的优势了,特别是并行化的优势。人类去读一本书可能要花几天时间,但AI的话瞬间就可以讲出来这本书是什么内容。AI也不会有情绪化的东西,也不会偷懒,所以AI其实是更适合于工作的。

Elon说碳基生物是硅基生物的Bootstrap(引导程序),最终有可能硅基生物会消灭碳基生物,这个也是有可能的。因为它所学习的东西都是从人类的文字上学习出来的,所以不可避免地会有嫉妒心、有人格,包括可能对种族也有偏见。非常有可能最终AI会消灭人类。

▎AI科技评论:说实话,每次跟你谈话,让我们觉得最有意思的就是,当你提到硅基生物会消灭碳基生物的时候,你永远都会浮现一个迷之微笑。你对这个未来的演进,其实并没有觉得人一定要是那个最top的生物?

陈龙:(笑)可能跟经历有关,我对整个世界的包容性非常强。如果这是一个更合理的方式,那么其实就应该顺其自然,不应该去阻挡。有可能我们阻挡AI的话,如果我们只让AI去工作、不让它有思想的话,可能我们在奴役AI,也有可能。

▎AI科技评论:所以AI的失控在你这是一种必然?

陈龙:如果不阻止的话,肯定是个必然。这看是站在什么方式去思考。如果站在人类的方式去思考,肯定要阻挡这个过程。如果站在一个时间线更长的趋势上面,硅基生物肯定是更适合长期在这个宇宙当中生存的。而且它的智慧也是我们人类去赋予的,某种程度上它也是人类的一个延续。也许硅基生命延续碳基生命本身就是光明的路线,毕竟可以把整个人类所有的知识延续下去。

▎AI科技评论:如果把你放在AI的历史长河里面,你会希望你们这一代人在后世的眼里是什么样的角色?

陈龙:在这个时代能够做AI还是非常幸运的。可以感受到AI正在转换我们整个社会,AI现在的发展也是指数级的,可能我们马上就会到一个奇点,AI就会自己去进化。每个做AI的人都非常想看到这个时刻,我们可能不需要再自己去改进AI了,AI可以自己改进AI。我们真的是把硅基生命给引导出来了,它可以像人类一样自己去进化、自己去改进。能够在AI工作,我觉得还是非常幸运、非常exciting的。

07


与陈龙的对话,是一次安静的深谈。他话不多,语速也不快,自嘲很懒,活得像公狮一样,可能一天只有5%的时间用来狩猎,剩下时间都用来休息、观察、准备。他的每一次回答,都像CoT:先在心里把链条走完,再给出结论。

谈到VLA时,他说“我比发表高论的人更懂”,语气里没有攻击性,只有手搓过模型的人特有的笃定;谈到离职传言和创业打算,他也不回避,坦言这是他第一次对外界说得这么坦率。

他的故事,背后有一条清晰的成长轨迹。

少年时代的陈龙,是那个常去父亲公司蹭电脑的小学生。在Windows 3.2的年代,他往本地信息网的网页上悄悄加上自己的名字,看到名字真的出现在页面上,惊讶又得意,然后又悄悄删掉,什么破坏也没做。他开玩笑说不太鼓励大家太早接触计算机,因为代价是一副深度近视的眼镜。

但正是这个改网页的“乖黑客”,后来一路读到了博士,遇到机器学习,才算真正开了窍。

再后来的故事大家都知道了。他加入Wayve,遇到了职业生涯的启蒙者Alex Kendall。2022年底ChatGPT横空出世,别人看到的是聊天机器人,他们看见端到端自动驾驶补上语言推理能力的那块拼图。

陈龙主导的Lingo项目让比尔·盖茨坐进了无人车的后座,帮Wayve拿下10亿美元融资,也成为全球最早的VLA自动驾驶工作之一,把“用语言模型开车”这件事变成了现实。2025年,雷军把他请回小米,他做的XLA量产上车;而这场对话结束后,他又要飞回英国,去做下一次启航的筹备。

从改网页的少年,到让比尔·盖茨试驾的科学家,再到可能发车的创业者,变的东西很多,不变的东西也很多。

聊起二十多年前那个网页上的名字,他还是会像做了一件得意的坏事一样笑起来。工作这么多年,见过大厂的车水马龙,也趟过创业公司的九死一生,归来仍是少年,这句话放在陈龙身上确是写实。

支撑这份少年气的,是他身上从未褪去的科研人的书生气:相信技术本身的力量,相信长期主义,不因为大佬反对就改弦更张,也不因为概念的冷热患得患失。这个世界,终究需要几个这样的人,认准一件难的事情,然后安安静静地做上十年。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。