屏幕越做越大、影音越堆越猛不说,光是驾驶功能就一路从自动保持车距、自动泊车升级到了自动帮你开车。

想当年学车时候苦练的手动挂挡、油离配合,如今几乎无处施展;再过几年,恐怕连倒车入库、侧方停车这种祖传功夫都不用练了,一键完成,全交给车自己去搞。

时代在变,而变化背后离不开两样东西:传感器和芯片。功能越复杂,需要的传感器就越多,数据处理量越大,芯片性能就得越高,这是一条几乎写死了的物理线。

打开网易新闻 查看精彩图片

举个最基础的例子,要想实现自动跟车,最简单的方案就是车头一颗摄像头加一颗毫米波雷达,一个看路况,一个测距离。它们采集的数据实时传给车里的SoC芯片,SoC负责综合两路传感器信息,再根据规控算法做决策,下达加速或减速指令。

为了确保安全,SoC旁边通常还会配一枚更小算力的MCU芯片,专管加减速指令的具体执行、控制油门刹车量,同时监管各路参数、与主控芯片互相校验。这两块芯片组合起来,就是自动驾驶的入门级"大脑",能跑最基础的辅助驾驶功能。

这一级传感器少,任务也不复杂,5TOPS的算力就够用了。业内通常会选TI的TDA4、Mobileye的Q4,或者地平线的J2、J3当主控;主打功能安全的MCU则常见英飞凌的TC3系列。

打开网易新闻 查看精彩图片

这些名字听着陌生,但现在市面上很多入门级带辅助驾驶的车,里面装的多半就是它们。

再往上,如果要实现完整的L2功能——全自动侧方位停车的"一键贴边"、自动按原路返回的"一键寻迹",以及最近吵得很热的城区NOA,传感器数量就不是一两个的事了,而是车身四周十几个雷达、摄像头再加高精度激光雷达同时上工。

5TOPS这时候立刻捉襟见肘,得换更大算力的SoC主控。市面上主流选项,特斯拉FSD、华为昇腾610、英伟达Orin-X,算力都在200TOPS上下。

其中最流行的是Orin-X,台积电7nm工艺,单颗254TOPS,用来跑现在的L2智驾已经绰绰有余。自研能力强的车企还会在算法上死磕,把芯片性能榨得更干净。

打开网易新闻 查看精彩图片

智己的工程师之前提到过,他们通过模型优化,把二阶算力需求硬生生降低了90%。这种数字背后不是玄学,是老老实实地写代码、剪模型、量化精度。

同样一颗Orin-X,装在不同车上跑出来的效果,可能差着两个身位。顺便把自动驾驶的分级也捋一遍,因为很多讨论其实是鸡同鸭讲。

国际通用的分级从L0到L5,自动化程度依次升高。L0是全手动,L5是全自动,中间几档差在哪?

如果把人开车拆成"动手、动脚、睁眼、思考"四件事,那L1做的就是让你别动脚,比如定速巡航;L2在L1基础上再让你别动手,比如开启城区NOA时手可以搭在方向盘上,但视线还得盯着,随时准备接管;

L3是让你连眼也不用睁,车自己开的时候你可以看电影甚至打个盹,要接管时车会提前通知你;L4就是高度自动驾驶了,在特定区域内完全无需人接管,比如真正意义上的无人出租车。

打开网易新闻 查看精彩图片

问题来了,L3、L4听着很美,为什么真到马路上就是不成熟?国内现在能买到的私家车,无论体验吹得多神,本质都还在L2里打转。

全球范围内号称能量产L3的车企也就那么几家,奔驰的Drive Pilot算一个,但它经常需要人接管,更要命的是——通知你接管只给10秒。10秒钟你要是没接过来,车自己就打双闪、减速、靠边停车。

这10秒对开高速的司机来说,实在太短了。号称L4的无人出租车也一样,每辆车背后都还站着安全员或远程监控人员,完全脱离人监督还做不到。

技术上离真正的"无人"到底还差多远?很多人第一反应是芯片算力不够。

打开网易新闻 查看精彩图片

但事实恰恰相反,前面说过,200TOPS已经能胜任L2;L3、L4的算力需求虽然更大,但可以通过堆芯片数量或提高核心密度来解决,有些方案直接上两块甚至四块Orin-X,硬件层面并不是死结。

真正卡住自动驾驶的,也不是传感器精度或者带宽。是软件,具体说,是算法层面机器对世界的"理解方式"和人类根本不一样。

清华团队最近有一项研究就直接点到了这个痛点:AI的世界不是只有算力、参数和数据规模,如果抓不住重点,堆再多资源也是浪费。

打开网易新闻 查看精彩图片

他们做的一件事,是研究同样是"看路"这个动作,机器和人到底差在哪。传统智驾方案走的是规控算法路子。

工程师根据交规、物理模型和各种边界情况,把开车这件事拆解成一堆if-else规则:前车距离小于多少米就减速,车道线偏离多少度就修正方向,红灯亮就停。这套逻辑清晰、可解释、便于调试,但缺点也很明显——真实道路上的情况太复杂,规则永远写不完。

老司机凭直觉一秒钟就能判断"这辆电动车要窜出来",机器却得先识别、再分类、再计算轨迹、再匹配规则,一顿操作下来,动作僵、反应慢,遇到没见过的场景直接懵。再看人脑是怎么开车的。

人脑不是万事都推理,绝大部分驾驶决策都是靠直觉,能耗低、反应快,只有碰到复杂情况才切换到主动思考。而且人脑非常擅长偷懒,同样的场景处理多次之后,会把对应的身体反应固化成肌肉记忆,下次再碰到直接执行,根本不过脑。

打开网易新闻 查看精彩图片

刚学车那会儿,什么时候挂几档、什么时候踩离合、什么时候打转向灯,样样都得想,CPU占用率飙到99%,紧张又费神,开得还差;开上一段时间,全都变成了下意识的丝滑操作。这就是逻辑驾驶和直觉驾驶的分水岭。

这里还有一个更本质的差别,清华团队用一个词说得挺准——"语义重要性地图"。人类司机开车,脑子里始终有一张这样的地图。

我们知道进路口时视线应该聚焦在可能窜出来的行人和电动车上,而不是路边商店的招牌;我们知道前车刹车灯亮起,比它车身的颜色重要一万倍。哪些信息重要、哪些不重要,人类几乎不假思索地分配注意力,这套本能是几十万年演化加几年生活经验共同训练出来的。

打开网易新闻 查看精彩图片

而机器没这套本能,研究里提到一个叫TOD³Cap的任务,要求模型对3D场景中的物体做密集描述,把语言和视觉信息精确对应起来。

清华团队发现,把人类"审视"阶段的注意力数据注入进去,模型性能直接飞跃了一大截。这背后的意思很扎心:大模型学会了逻辑,但在把逻辑跟真实世界的具体像素精确链接这件事上,依然存在巨大的"接地鸿沟"。

它认识"行人"这个概念,但要它在昏暗的雨夜、复杂的背景里,精确地"指认"出那个正要横穿马路的关键行人,依然困难。这就解释了为什么很多智驾系统在标准工况下表现优秀,一遇到雨雾、逆光、施工路段就掉链子。

不是算力不够,是它没有人类那种"这个像素比那个像素重要"的直觉。规控算法可以穷举规则,但穷举不了注意力。也正因如此,业内近两年才会集体转向"端到端大模型"路线。传统方案是把感知、决策、控制拆成一段一段的模块,每一段单独训练、单独调优,中间靠人写的规则和参数拼接。

打开网易新闻 查看精彩图片

端到端则是从传感器输入到方向盘输出一整个大模型直接学出来,让机器像人一样,从原始画面到最终动作一步到位,中间不用人为拆解。智己和Momenta最近搞的"汽车直觉",就是沿着这条路走的。

他们的智驾大模型模仿人脑,用"直觉+逻辑"的双通道来处理智驾问题:绝大多数常见场景走直觉,快而省能;碰到复杂情况再切换到逻辑推理。

更有意思的是,大模型的自我学习和迭代采用了"短期+长期记忆"结合的模式,同样借鉴人脑的经验积累过程——刚学到的新东西先放短期记忆里检验,反复稳定之后再沉淀进长期记忆。

这种一段式端到端方案如果真能突破现有规控算法的天花板,不光让L2的智驾体验更像人,还能把真正的L3、L4级自动驾驶大幅提前。当然,自动驾驶的推进除了硬件和算法这两条腿,还需要第三条腿——法律法规。

打开网易新闻 查看精彩图片

人开车已经开了一百多年,配套的交规、保险、事故认定都磨得很成熟;车开人才刚刚几年,自动驾驶下的权责怎么划分、出了事故到底该找车企还是找车主、AI能不能开得比人类更好,这些问题都还需要更多时间来回答。好消息是节奏在明显加快。

国内乘用车的L4级测试才刚刚开放,智己是首批拿到L4测试牌照的车企之一,也是全国首个同时具备从L2到L4级自驾量产能力的品牌。

这对于国产汽车是一个不容忽视的优势——因为可以用更多真实道路上跑出来的L4级数据,反过来去完善和拓展现有的L2、L3功能。数据、模型、场景,三者互相喂养,滚雪球一样越滚越快。

从更长的时间尺度看,自动驾驶的进化其实是一场芯片、算法、数据、法规四条线并行推进的接力赛。任何一条腿短了,整体都跑不快。

打开网易新闻 查看精彩图片

过去几年大家过度聚焦在算力这一条腿上,把TOPS当成信仰,一味比拼谁家的芯片数字更大,反倒有点走偏了。清华团队这次的研究,是把大家的注意力重新拉回到了真正的瓶颈——机器如何像人一样"看"路。

这也意味着,接下来智驾行业的竞争,会从硬件军备赛慢慢转向软件和数据军备赛。谁能收集到更多样、更极端的真实道路场景,谁能训练出更接近人类直觉的大模型,谁能在算法层面把有限算力榨到极致,谁就能真正跑出L3、L4的临门一脚。

在AI和智能化的浪潮下,从工业质检到交通出行,无数纳米级的芯片正驱动着人类文明往前走。但真正决定它们能走多远、走多稳的,还是芯片里那些看不见摸不着的"常识"。

人类花了几十万年才把"看路"这件小事内化成本能,机器要走完这段路,恐怕还要一段时间。但至少方向已经找到了——别再一味堆算力,学着像人一样看世界。