上周,我探访了斑马智能。在现场实车里,只说“刘德华和梁朝伟在天台对峙”,座舱便能找到《无间道》;告诉它“先回家拿东西,再去接朋友,最后去哈利·波特主题乐园”,系统会把一句自然语言拆解为多站路线;说“我看不清前面的路”,它需要越过字面意思,理解为开启前挡除雾。最容易吸引眼球的,是这些看起来接近人的交互,但真正让我感兴趣的,反而是演示中那些不够完美的瞬间。

打开网易新闻 查看精彩图片

一些小插曲比一场剪辑得天衣无缝的发布会更有价值,因为它们揭示了智能汽车研发的本质:把大模型接进车机,只是整个工程最前面的一小段;真正困难的,是让感知、理解、决策和执行穿过操作系统、芯片平台、车辆接口与服务生态,并在弱网、多人、长生命周期和安全约束下持续稳定地工作。

一、不是把大模型装进车里,而是把AI变成系统

今天几乎所有车企都在谈“大模型上车”,但大模型本身并不会直接打开空调、选择座位或完成支付。一条看似简单的语音指令,至少要经过感知输入、意图理解、任务规划、服务或车控接口调用、底层执行以及结果反馈六个环节。只要其中一环数据不准、接口缺失、权限不足或网络波动,用户看到的就是“它听懂了,却没办成”。

一条指令的研发链路 语音/视觉感知 → 模型理解 → System Agent规划 → 服务与车控接口 → OS及硬件执行 → 结果反馈与失败恢复

这也是车载AI和手机AI最大的差别。手机助手答错一次,通常只是体验不好;车载系统误解“把灯关掉”、错误调整驾驶相关功能,可能带来安全风险。因此,汽车研发追求的并不是模型“什么都敢做”,而是系统知道什么可以直接做、什么必须确认、什么应该拒绝,以及失败后如何安全回退。真正的智能,不是能力没有边界,而是边界清晰、过程可控、结果可解释。

二、最不显眼的OS,决定上层智能能走多远

斑马智能的特殊之处,在于它并不是从聊天机器人切入汽车,而是从汽车操作系统一路向上生长。其公开业务结构可以概括为三层:底层是以AliOS为核心的系统级操作系统,中间是元神AI所代表的AI全栈方案,上层则是车载平台服务。现场交流之后,我对智能座舱的构成有了更具体的认识。它显然不是一块中控屏或者一个语音助手那么简单,而是从底层的内核、虚拟化、中间件,一直延伸到上层的模型、Agent 和服务生态,一层层叠起来的完整系统。

打开网易新闻 查看精彩图片

在车辆内部,仪表、车载娱乐、导航、整车控制以及辅助驾驶等多类软件会并发运行,但各类业务对功能安全等级、任务实时性的指标要求差异巨大。Hypervisor负责隔离不同系统,RTOS承担实时任务,Android或Linux提供应用生态,中间件把芯片能力和车辆服务抽象成可调用接口。上层AI要想稳定工作,首先必须建立在资源可调度、故障可隔离、接口可管理的OS之上。换句话说,大模型决定一辆车“能想到什么”,操作系统决定它“能不能可靠地做到”。

这也能说清行业里一个常被误解的事儿:车企自研和找第三方合作,根本不是二选一的关系。

主机厂抓的是品牌体验、产品定义和最终安全责任,技术伙伴负责把 OS、模型、Agent、平台模块这些东西做成熟、做可复用。不同车型可以挑几个模块自己拼,也可以直接上整套方案。消费者看到的都是车企自己的界面和唤醒词,背后谁联合研发的,一般不会打 Logo。

斑马官网给的数字是,智能座舱方案已经合作了 69 家主机厂,装在超过 1000 万辆车上。这个规模的意义不只是 "量大",更关键的是同一套能力已经在不同芯片、不同车型、不同研发流程里被反复打磨验证过了。

三、端云协同不是选择题,而是动态分工

车载大模型的发展正在同时沿着两个方向前进:云端模型越来越大,端侧模型越来越精简;与此同时,车载芯片算力与内存带宽持续提升。最终不会是“只用云”或“全部在车端”的二选一,而是根据任务、网络、时延、隐私和成本进行动态分工。

打开网易新闻 查看精彩图片

云端能干复杂的事儿,比如多轮推理、查实时信息,但没网就抓瞎,而且用一次算一次的钱。端侧模型就实在多了 —— 地下车库没信号也能用,数据不用传出去,常用功能反应快,也不用一直为 Token 费用买单。斑马智能的 AutoOmni 走的就是端侧这条路线,主打全模态感知、长期记忆和主动服务。按官方说法,90% 的 "感知 — 决策 — 执行" 链路都能在车机本地直接跑完,不需要绕一圈上云。但端侧模型上车绝不等于把一个压缩后的模型文件拷进车机。研发团队还要处理模型量化与裁剪、不同SoC适配、功耗与散热、摄像头和麦克风时序、车内多人识别、车辆总线接口、UI反馈和异常恢复。模型在实验室里跑起来,只能证明“可行”;在数十种硬件平台上长时间稳定运行,才叫产品。端云协同真正考验的,是系统在每一刻都能选择合适的执行位置,并在切换时不让用户感到割裂。

打开网易新闻 查看精彩图片

四、Agent的难点不在会聊天,而在把事情办完

大模型解决的是“听懂”,Agent解决的是“行动”。在现场体验中,影音搜索不再要求用户记住片名或歌名,系统可以根据剧情、台词和人物进行模糊检索;订电影票时,它需要继续完成影院筛选、场次选择、座位调整和支付确认;多目的地出行则需要调用地图、地点知识和路线规划。斑马智能的架构是由System Agent统筹多个场景Agent,AutoClaw进一步面向跨任务、跨服务的动态规划。其目标可以概括为一句话:从一次只做一件事,走向围绕一个目标连续办成多件事。

打开网易新闻 查看精彩图片

斑马交流的时候提到,他们更愿意走 API 直接对接这条路,而不是让 AI 在后台模拟手指一下下点 App。前者反应更快,状态也更清楚,在车上更容易把事儿办完整。

但 API 对接也不是接上就万事大吉了。片源有没有、库存准不准、会员通不通、位置对不对、账号登没登、支付走不走得通、隐私授权给没给、网络稳不稳,哪一环出问题都可能断。到了车控这块就更麻烦,不同车型的接口不一样,软件版本也有差异,这些都得一个个搞定。一个Agent的可靠性,往往取决于整条链路里最弱的数据、最弱的接口和最弱的异常处理。

因此,“No Touch, No App”不是一句把App入口藏起来的口号,而是一次服务入口的迁移:用户不再先想该打开哪个App,而是直接表达目的,由系统级Agent决定调用谁。谁手里的服务更多、授权关系更清楚、质量也稳定,谁就更有可能抢到车内那个 "帮你办事" 的入口位置。

所以往后看,智能座舱的竞争,光比模型好不好使已经不够了,很大程度上得比谁能把更多服务聚合进来、谁能把流量和资源分配明白。

五、越主动、越懂你,越需要清晰的安全与隐私边界

端侧视觉和长期记忆让座舱有机会“常聆听、常观察、善记忆”:系统可以识别车内有人、理解乘员偏好,在用户感到热时同时照顾副驾,或根据历史习惯主动提醒。可汽车不是一部只属于单个账号的手机,它会载家人、同事和临时乘客,也会记录位置、对话、影像和出行轨迹。越是个性化,数据就越敏感。

打开网易新闻 查看精彩图片

我在自己的智能车上也遇到过类似问题:一句“为什么零重力座椅打不开”,系统只能告诉我无法执行,却不能说明究竟是座椅后方有障碍、当前姿态不满足,还是某项安全条件没有达成。真正成熟的智能座舱,不只要会执行成功,也要解释为什么不能执行。记忆功能也是一个道理,得先掰扯清楚:到底是谁同意你记住这些的?驾驶员的授权是否覆盖副驾?哪些数据只存车端,哪些会上云?用户能否查看、删除或一键关闭?

大模型天生就是 "猜" 着来的,但车控这事儿容不得半点含糊。

比较靠谱的做法是各管一摊:大模型负责听懂你说的话、搞懂上下文;规则、状态机和安全策略负责把关校验;OS 把资源和权限隔离开;车控域只执行已经确认过的指令,拿不准的就交回给人来决定。

说白了,真正的安全不是指望模型永远不犯错,而是就算它错了,这个错也翻不出权限的围墙,更不可能变成车的安全事故。

这也是ISO 26262功能安全、UN R155网络安全、UN R156软件更新管理和Automotive SPICE开发过程评估之所以重要的原因。它们看起来不像炫目的AI功能,却规定了软件如何被开发、验证、更新和追溯。斑马智能公开信息显示,其Hypervisor和RTOS已通过ISO 26262 ASIL-D产品认证,元神AI也已通过Automotive SPICE 4.0 CL2评估。对车载AI而言,模型能力只是入场券,车规化才是量产通行证。

六、真正的护城河,是从演示到量产的工程能力

AI 模型可能一个月甚至几周就更新一版,但车从立项到量产得熬好几年,卖出去之后还得持续服务很多年。研发团队必须在车型冻结、硬件约束、法规认证和供应链节奏之间,把不断变化的模型能力封装成可测试、可复用、可OTA的产品。所以汽车 AI 这事儿,最后不会变成几家大模型厂商的独角戏。真正拉开差距的,还是场景数据够不够多、端侧适配做得深不深、系统集成稳不稳、服务生态全不全、交付体系跟不跟得上。

从这个角度看,智能汽车研发的护城河至少有四层:第一,能否贯通芯片、OS、模型、Agent和服务;第二,能否与主机厂共同定义功能,而不是只交付一个标准软件包;第三,能否把功能做到车规级稳定,并在不同车型上规模复制;第四,能否在车辆交付之后持续运营生态、修复问题和升级体验。前两层决定产品上限,后两层决定商业是否成立。

商业模式也会反向影响研发方向。现在车企都在打价格战,用户也没养成订阅付费的习惯,这种情况下光 "接个大模型" 进去,说白了就是多一笔成本。

真正能跑通的前提是,这个 Agent 得真能帮用户省时间、解决日常高频的问题,或者把内容、出行、本地生活、车本身的服务串成一个闭环。做到这一步,AI 才不只是配置表上多一行字,而是能持续运营、产生价值的平台。但车内服务不能复制手机互联网争夺注意力的老路;汽车场景的第一价值仍应是安全、效率和低打扰。

结语:智能车的科技含量,越来越藏在看不到Logo的地方

本文截稿时,在刚刚召开的第二十九届成都国际汽车展览会上,我们也看到斑马智能与宝马、智己、红旗、奇瑞等车企合作的车型在陆续上市。

这次探访之后,我最大的感触是:现在看一台车智不智能,真不能光盯着芯片什么型号、屏幕多大、语音能不能连续对话、或者接了哪家的大模型。值得追问的是三件事:它能否理解真实而模糊的需求;能否跨过数据、接口和账号,把任务真正完成;能否在持续进化的同时,不越过安全与隐私边界。

当这三件事都能被可靠回答,汽车才可能从“带轮子的智能终端”进一步走向真正的轮式机器人。在此之前,行业最重要的工作不是继续堆砌演示功能,而是把每一次感知、每一个决策、每一条接口和每一次失败,都做成可验证、可追溯、可安全恢复的系统能力。

未来一辆车的科技含量,或许会越来越藏在那些消费者看不到Logo的地方:操作系统的隔离与调度、端侧模型的压缩与适配、Agent背后的任务编排、服务接口的协同,以及贯穿整车生命周期的质量体系。屏幕上那句自然流畅的回答,只是最后一米;真正漫长的研发,都在它背后。