编辑|+0

一个人结束一天的工作,从公司走到停车场。

手机已经知道下一段日程和回家的路线。上车后,这些信息自然流转到车机。车辆驶入熟悉的生活半径,家里的空调提前调整温度,灯光切换到合适状态。到家后,手机上刚整理好的文件,又能无缝交给电脑继续处理,最后调用打印机输出。

打开网易新闻 查看精彩图片

这样的场景,过去常出现在科幻电影里。电影会给它安排一个无所不知的智能管家,但现实中,这些能力往往分散在手机、汽车、电脑、传感器、家电,以及后台运行的模型和系统中,再通过连接共同完成任务。

这也是物理 AI 与过去生成式 AI 的重要区别之一。

「chatbot 可能是上半场大模型的主要场景。到了物理 AI 之后,比较重要的是感知,通过感知能够知道人的意图,帮助人完成复杂任务的执行。」小米总裁卢伟冰在 IFA 期间接受媒体采访时表示。

而这恰好也是小米这家公司在这一轮竞争中的特殊之处。

它同时拥有手机、汽车和家庭三个高频物理空间入口,并且已经把芯片、AI、操作系统和制造能力逐步补齐。单看任何一项,小米都不是唯一参与者,但把这些能力同时放进一个消费生态,是它难以复制的地方。这也让小米成为全球首个在「人车家全生态」落地物理 AI 的公司。

打开网易新闻 查看精彩图片

今年 IFA,小米在超过 3000 平米的展台上展出近 400 款产品,从手机、电脑、家电,到汽车、人形机器人和玄戒芯片。这也是「人车家全生态」目前规模最大的一次海外集中亮相。

据卢伟冰透露,小米目前已经积累了 7.6 亿手机和平板设备、接近 12 亿 IoT 连接设备,加起来接近 20 亿联网智能设备,都可以成为物理 AI 落地执行的主体。

打开网易新闻 查看精彩图片

比产品数量更重要的,是一些过去分散的 AI 能力已经开始连接起来。

小米将其概括为主动感知、复杂执行和主动服务。

开头那些看似科幻的场景,在展台上已经能找到对应:人在回家途中,家庭设备可以提前响应;一句话可以让照片在手机、PC 和打印机之间继续流转;当系统感知到用户拿起书准备阅读,环境也可以随之调整。

这些能力开始把原本分散在不同终端上的感知、理解和执行串成一个闭环。

当 AI 开始真正调用汽车、家电、机器人这些现实世界的设备,竞争也从模型能回答什么,转向谁能让 AI 稳定、连续地作用于真实生活。

当 AI 开始「行动」,设备就不只是设备

过去三年,AI 行业的聚光灯大多打在前沿模型上。

上下文越来越长,多模态、推理和 Coding 能力不断提升,参数、benchmark 和推理效果,也成为衡量 AI 进展最直观的方式。

但到了物理 AI 阶段,竞争开始增加新的维度。当 AI 只需要回答问题时,模型本身很大程度上决定体验;但当 AI 开始进入现实世界,它不仅要完成理解和推理,还要感知环境、调用设备,并把判断稳定地转化成现实动作。

AI 的工作链条因此从「理解和生成」,进一步延伸到「感知—理解—规划—执行—反馈」。

这也让小米过去在终端和生态上的布局开始显出新的价值。手机、汽车和家庭,恰好是小米已经覆盖的几个高频生活场景。

手机可以提供位置、图像、声音和应用信息;汽车拥有摄像头、雷达、导航和车辆状态;家庭里则分布着门锁、摄像头、温湿度传感器、空调、扫地机器人和各种家电。

这些设备过去首先是独立的硬件产品。到了物理 AI 阶段,它们开始拥有另一层意义:既是 AI 感知现实环境的入口,也是 AI 可以调用的执行端。

当然,有设备还不够。

过去几年,VLA、世界模型、机器人基础模型和合成数据受到关注,本质上都在解决同一个问题:怎样让 AI 不只理解文字和图像,还能理解现实环境,以及一个动作会带来什么结果。

进入 2026 年,物理 AI 的系统架构也开始出现更清晰的分层:高层 Agent 负责理解目标和规划任务,底层模型与控制系统负责实时执行。

这意味着,物理 AI 的竞争不再只发生在模型层。

今年 3 月,英伟达在 GTC 关于物理 AI 的技术分享中,也把真实部署的问题落到了多模态感知、响应延迟、本地算力和设备资源等具体环节。

打开网易新闻 查看精彩图片

换句话说,物理 AI 并不是简单地把大模型装进硬件。真实部署还需要端侧算力、操作系统、传感器和执行器共同参与:AI 不仅要完成推理,还要知道有哪些设备、设备处于什么状态,再把判断稳定地转化为现实动作。

而这些过去分散在不同技术和产品里的能力,在小米身上已经开始连接起来。

今年 IFA 的小米展台上,这条链路已经能够看到雏形:芯片、手机、汽车、家居设备和机器人,被放在同一套 AI 展示逻辑里。

更重要的是,这些设备并不是彼此孤立的。

过去的智能家居,核心是设备联网和规则自动化。温度超过某个阈值打开空调,固定时间启动扫地机器人,回家以后自动开灯,本质上都是用户提前设定条件,设备按照规则执行。

大模型和 Agent 加入以后,系统开始处理更模糊、更接近人的需求。比如「今晚有朋友来家里吃饭」,背后可能涉及空调、灯光、扫地机器人和音箱等多个设备。系统需要结合时间、环境和历史习惯理解任务,再决定调用哪些设备,以及按照什么顺序执行。

到了这一步,终端和生态在 AI 竞争中的权重也开始上升。而这正是小米过去十几年一直在积累的东西。

小米已经先把现实世界的入口铺好了

这个入口到底有多大,可以从几个数字来判断。

截至 2026 年 6 月 30 日,小米手机和平板的全球月活已经达到 7.6 亿、小米 AIoT 平台连接的 IoT 设备达到 11.6 亿,拥有五件及以上连接设备的用户达到 2460 万。同期,小爱同学月活跃用户达到约 1.75 亿,米家 App 月活达到约 1.24 亿。

其中,2460 万多设备用户尤其值得关注。

一台设备联网,能够解决的任务很有限;当一个家庭同时拥有摄像头、门锁、空调、电视、扫地机器人、音箱和穿戴设备以后,AI 才拥有更多可以组合的感知和执行能力。

这也是为什么在物理 AI 的语境里,多设备用户会成为一个很有参考价值的指标:它更接近跨设备 Agent 真正发挥价值所需要的环境。截至今年二季度,五件及以上连接设备用户还在同比增长约 20.2%。

手机提供了一个关键入口。

2026 年第二季度,小米智能手机出货量约 3120 万台,全球排名第三。手机仍然是目前最接近个人的通用计算设备,拥有账户、位置、应用、相机、麦克风和本地算力,也天然适合作为个人 AI 的入口。

打开网易新闻 查看精彩图片

汽车则补上了另一块拼图。

一辆智能汽车本身就是复杂的物理 AI 终端,既拥有大量传感器和端侧算力,也可以通过空调、座舱、动力、转向和制动系统真实影响环境。

截止到 7 月,小米汽车累计交付已经达到 70 万辆,「人车家」里的「车」开始从战略概念变成一个拥有真实用户和使用频率的节点。

打开网易新闻 查看精彩图片

手机、汽车和家庭连接起来以后,AI 才能跟着人的生活场景一起移动。

一个人的日程、内容、习惯和需求,会随着他在家庭、汽车和个人设备之间不断迁移。系统不仅需要知道用户是谁、之前发生过什么,还要理解当前环境、身边有哪些设备可以调用,以及哪些动作已经获得授权。

这也是消费级物理 AI 比实验室 Demo 更复杂的地方。

家庭结构、作息和设备组合高度分散,同一个动作在不同时间、不同成员和不同场景下,可能对应完全不同的需求。系统越主动,需要理解和处理的细节也就越多。

对于小米来说,7.6 亿台手机平板、11.6 亿 IoT 连接设备,首先提供了足够大的设备基础;汽车加入以后,这套设备网络又从固定家庭空间延伸到了移动空间。

我们可以把小米做物理 AI 的基础概括成一句话:它已经拥有足够多进入现实生活的入口。也正因如此,小米得以率先把物理 AI 从单点能力推向全生态协同。

真正难的,是把这些能力串起来

有了这些入口,接下来要解决的是设备之间的协同。

不同产品拥有不同算力、不同传感器、不同生命周期。一台手机每两三年可能更新一次,一台空调可以使用十年;机器人需要处理运动控制,门锁更强调权限和可靠性,汽车对实时性和安全性的要求又高出很多。

让 AI 在这些设备之间工作,需要一条很长的技术链。

目前小米逐渐搭出来的,是从芯片、模型、OS,一直到汽车、家电、机器人和制造环节的一整套体系。

先从最底层的算力说起。

物理 AI 对端侧计算的需求会越来越高。家庭摄像头、汽车和穿戴设备会产生大量涉及隐私和实时性的信号,很多控制任务也无法依赖持续的云端往返。网络波动对灯光控制影响有限,但对汽车和机器人来说,延迟和本地算力会直接影响系统表现。

2025 年,小米推出自研旗舰手机 SoC 玄戒 O1,材料披露其累计出货量已经超过 100 万。2026 年,玄戒进一步扩展到旗舰 AI 处理器 O3、高带宽 AI 加速芯片 O100,以及面向智驾高算力需求的 D100。三颗芯片正是构建「人车家全生态」的 AI 算力基础。

芯片解决在哪里算,模型则负责怎么理解。

2026 年,小米 MiMo 模型继续迭代 V2、V2.5 系列,覆盖文本、图像、视频和音频等多模态输入,并向 Coding 和 Agent 能力延伸。对物理 AI 来说,多模态能力直接对应现实环境中的时间、位置、声音、人体状态和设备信息。

今年 6 月,小米发布 Miloco 2.0。这套以 MiMo 为核心的全屋智能 AI 方案加入了多维感知、家庭记忆、主动服务和长期任务等能力,开始从过去基于规则的自动化,进一步走向对家庭状态的持续理解和任务执行。

打开网易新闻 查看精彩图片

模型理解之后,还要找到正确的设备,这一步主要由操作系统和设备平台完成。

澎湃 OS4 Beta 搭载 MiMo 和 AI 化改造后的超级小爱 2.0,据小米此前披露,超级小爱 2.0 专家版,已经具备自己思考、自己规划、自行调用设备和执行任务的能力,支持跨应用、跨设备复杂任务。此外,面向大量低算力 IoT 终端,小米还有 Vela 这样的嵌入式软件平台,让不同硬件继续进入统一的软件和控制框架。

机器人把这条链路进一步延伸到更复杂的物理执行。

今年小米公布了 Xiaomi-Robotics-U0 和 Xiaomi-Robotics-1。根据公司公开资料,前者是一款 380 亿参数的多模态具身世界基础模型,后者使用超过 10 万小时真实世界移动操作轨迹进行预训练。

打开网易新闻 查看精彩图片

在小米汽车工厂,机器人在自攻螺母工站上件的双侧任务成功率已经提升到 98%;中控台侧盖分拣和周转箱折叠任务成功率约为 90%。这说明这些能力已经进入真实工位,在重复、高频、结果可量化的生产任务中接受验证。

这也体现出小米自有制造体系的另一层价值。

对物理 AI 来说,工厂还提供了一种消费场景很难稳定获得的高频反馈:任务明确、结果可量化,同一种动作可以反复执行。手机、汽车和家电生产线本身就包含大量视觉、搬运、装配和柔性操作任务,可以成为机器人模型和控制系统持续获取反馈的场景。

可以看到,小米目前形成的路径已经比较清晰:芯片提供端侧计算,MiMo 负责理解和推理,澎湃 OS、Vela 和 IoT 平台连接终端,超级小爱和 Miloco 承担任务编排,再由家电、汽车和机器人执行动作,执行结果继续反馈到产品和模型迭代。

小米的优势在于,这些原本分散的能力正在同一个覆盖手机、汽车和家庭的消费生态里发生联系。

十几年积累,开始体现新的价值

如果说过去十几年,小米做手机、IoT、家电、汽车,是在不断拓宽业务边界,那么到了物理 AI 时代,这些原本分散的业务,开始指向同一个方向。

过去,系统首先解决的是设备之间怎么连接;现在,它开始进一步回答,AI 如何理解一个人的需求,再跨设备把事情完成。

最终,用户未必会感知到背后调用了多少模型、芯片和终端。真正好的体验,可能只是少一次设备切换,少一次重复表达,少一次重新设置。

而对小米来说,这也是过去十几年积累开始显出价值的时刻。覆盖「人车家」的设备基础,加上芯片、AI、OS 和制造能力,正在成为它进入物理 AI 时代最难以复制的一张底牌。