田晏林 发自 凹非寺
量子位 | 公众号 QbitAI

具身智能圈,又传来两条重磅消息。

刚刚,Om AI联汇完成数亿元融资,前海母基金领投。

同一天,该公司旗下全球首款端侧原生模型VLX-Seek 1.5宣布正式开源。

打开网易新闻 查看精彩图片

表面看,这是融资、开源两件事。

资本在下注一种新路线,开发者正在获得一个新入口。

但放在一起看,很难不让人想起20年前亚马逊AWS开启云计算时代的那一刻。

当年,AWS一边全面开放API吸引海量开发者接入,一边获得资本投入验证路线价值。

最终,云计算没有成为简单的服务器租赁生意,而是演变成一套新的基础设施范式。

如今的物理AI,也在寻找自己的「原生时刻」

Om AI联汇定义了一种怎样的范式?在物理AI的全局坐标轴中,它处于什么位置?

全球物理AI,图谱更新

全球物理AI,图谱更新

过去几年,AI行业的竞争经常围绕更大的模型、更多的数据、更强的云端算力展开。

从大语言模型到多模态模型,参数规模一度成为衡量能力的重要指标。

但当AI走向真实世界,机器人面对的不是一张张静态图片,也不是一次次文本问答。

它需要在工厂、仓库、家庭、户外等复杂环境中持续运行。

这时,竞争规则也发生了变化。

决定模型价值的不再只是参数量,而是几个更加现实的问题:

响应延迟够不够低?端侧算力能不能承受?部署成本能不能规模化?设备能不能脱离云端独立运行?

因为在物理世界里,每增加一台机器人、无人机或智能终端,都意味着真实的硬件成本、能源成本和维护成本。

打开网易新闻 查看精彩图片

如果我们把今天全球物理AI模型的路线放在一张地图上会发现,围绕「如何让AI理解并行动于物理世界」这一大命题,全球玩家正在形成几条不同方向。

NVIDIA Cosmos选择的是「云端世界模型」路线

它的核心目标,是帮助AI理解物理环境,通过世界模型能力构建更加丰富的空间认知基础。

Physical Intelligence的π系列,则探索「云端通用机器人策略模型」,希望通过大规模训练让机器人具备跨任务泛化能力。

Google Gemini Robotics则沿着「云端VLA」方向推进,将语言理解、视觉感知和机器人动作连接起来,让机器人能够根据自然语言完成任务。

而另辟蹊径的Tesla Optimus,更强调模型与机器人本体之间的闭环,通过自有硬件平台推动机器人能力迭代。

这些路线并没有谁绝对领先。

打开网易新闻 查看精彩图片

它们分别回答了不同问题:如何让AI理解世界?如何让机器人获得通用能力?如何让模型与硬件协同?

但在这张图谱里,有一个关键坐标此前并未有过专门的回答,那就是:

如何让一个AI模型从诞生开始,就适应端侧环境?

这是Om AI联汇想填补的位置。

其自研的VLX端侧流式多模态模型系列强调「端侧原生」路线,它不依赖云端大算力,也不绑定单一硬件平台。

模型也并非先在云端训练完成,再被压缩部署到设备。

而是在模型设计阶段,就把端侧算力、延迟、功耗和部署成本作为约束条件。

这两者看似只是部署方式的不同,本质上却是两种不同的技术哲学。

前者是在问:如何让一个强大的AI模型跑到设备上?

后者是在问:如果AI生来就在设备上,它应该长成什么样?

这也是「端侧部署」和「端侧原生」最大的区别。

打开网易新闻 查看精彩图片

毕竟机器人真正进入千家万户、进入大量工业场景,不可能永远依赖远端的云端大脑。

当前,在全球物理AI模型竞争版图中,端侧原生正在成为一个新的关键方向。

而Om AI联汇最先看到图谱上的缺口,用VLX补上了。

拆解“端侧原生第一家”

拆解“端侧原生第一家”

对于「端侧」的探索,不少AI模型很早就展开了。

大家都清楚,云端大模型虽然强大,但也有天然限制。

机器人如果每一次感知都需要上传云端,再等待结果返回,就像让一个人在运动时,每个动作都要先打电话询问远方的大脑。

网络延迟存在,数据传输成本存在,隐私问题也存在。

但工厂里的机器人,需要全天候工作;巡检无人机,需要在没有稳定网络环境的地方执行任务;家庭机器人,需要保护用户隐私。

这些场景决定了,物理AI不能永远依赖云端大脑。

业内之前的解决方案通常是:先训练一个大模型,再通过压缩、蒸馏、量化等方式,让它适配端侧。

这种「迁移式部署」的方式,模型本身仍离不开云端,只是努力让自己「变得更轻」。

Om AI联汇想彻底打破限制。

打开网易新闻 查看精彩图片

VLX从模型架构层就开始考虑端侧环境,把延迟、功耗、算力、部署成本作为设计前提,而非优化目标。

也就是说,模型不是一个被迫「减肥」的大模型,而是一个天生适合端侧环境的AI。

这个区别决定了物理AI能不能大规模、快速地走出实验室。

端侧原生带来的价值是直接的:更快响应、更低成本、更强自主性,以及让物理AI进入工厂、家庭、无人机巡检、智能终端。

而这种大规模落地要求模型具备本地理解能力、持续交互能力和低成本部署能力。

这也是为什么端侧原生并非一个营销概念。

它实际上代表了一条新的架构路线,决定着未来物理AI如何进入千千万万个真实设备。

不过,路线判断最终需要技术验证。

一个面向端侧设计的模型,是否真的能挑战更大的模型?

VLX-Seek 1.5:我能!

3B模型碾压英伟达、谷歌

VLX-Seek 1.5有3B、10B两个版本,参数规模都不大。

如果说端侧原生架构是其战略选择,那么流式多模态就是其以小搏大的战术优势。

传统VLM的工作流是这样的:摄像头拍一张照片,上传到云端,等待模型推理,返回结果。

这是典型的批处理模式英伟达、Google等巨头的路线本质上都是这个逻辑。

由此带来的问题则是延迟高、带宽依赖大、隐私不可控。并且,它把物理世界的连续感知切割成了一帧帧的静态快照。

VLX-Seek 1.5的流式多模态架构完全不同。

它接收的是视频流持续输入,在端侧实时理解,动态输出决策。三层心智链路构成了完整闭环:

  • Flow=持续注意力,让模型从看不见到看得清;
  • Seek=精细推理,让模型从看不准到看得准;
  • Go=执行控制,让模型从动不了到自主行动。

打开网易新闻 查看精彩图片

从「拍照识别」到「视频流理解」的范式变化,反向验证了同参数级别能赢巨头的关键,不在参数,而在架构。

在VLX-Seek 1.5公开的评测中,Om AI联汇测试了3B和10B两个版本,覆盖通用目标检测、指代表达理解、无人机视角感知、具身空间推理以及目标幻觉等多个方向。

同场比较的模型,不仅包括自家上一版的VLX-Seek,还有英伟达的LocateAnything等检测增强型VLM,以及多个更大的开源或闭源模型。

结果显示,VLX-Seek 1.5不仅提升了细粒度视觉理解能力,同时在无人机定位、具身设备空间推理等场景中展现出竞争力。

其中,最具代表性的,是3B参数版本与同规模模型(LocateAnything-3B)的比较。

在通用检测任务中,VLX-Seek 1.5-3B在LVIS Mean指标(衡量开放集定位模型对上千种物体,包含大量稀有物体的框选能力)达到57.5,相比LocateAnything-3B(50.7),提升13.4%。

打开网易新闻 查看精彩图片

这意味着,在复杂长尾目标识别中,小参数模型并没有因为规模限制而退化。

在更接近真实交互的指代表达理解任务中,VLX-Seek 1.5-3B在RefCOCOg test Mean(语言描述定位目标物体)达到80.2,相比LocateAnything-3B,提升3.4%。

简单来说,人类说一句:找到那个靠近桌角的小盒子。

模型不仅要识别盒子,还要理解空间关系。这考验的不是单纯视觉能力,而是视觉和语言之间的深层关联。

真正拉开差距的是无人机视角场景。

对于无人机来说,目标往往非常小、距离远、视角高、环境复杂。传统模型很容易出现漏检或者误判。

而在RefDrone测试中,VLX-Seek 1.5-3B的F1指标达到73.2,相比LocateAnything-3B的52.3,提升40%。

实例准确率Acc达到58,相比LocateAnything-3B(35.6)提升62.9%。

打开网易新闻 查看精彩图片

这些结果说明,在极端视角和小目标场景下,端侧原生架构正在展现不同于传统路线的效率优势。

VLX-Seek 1.5验证了一件事:巨头路线依靠更大规模解决问题,但端侧原生路线通过更适合物理世界的架构,也能提高单位参数价值。

不过,在实际部署时,仅有强识别能力还不够。

模型最大的风险是「过于自信」。

对于聊天机器人,有时候过于自信的结果,就是给出一次错误的回复。

但对于机器人、无人机和安防系统,模型的一次错误判断可能直接触发错误动作,对真实世界安全造成不可挽回的影响。

为了解决这个问题,VLX-Seek 1.5引入目标幻觉指标,用于衡量模型是否会产生不存在目标的误报。

该指标定义为:Object Hallucination = FP/Number of GT Objects。

其中,FP代表针对实际不存在请求目标产生的假阳性检测,数值越低,说明模型产生的目标幻觉越少。

在RefDrone目标幻觉评测中,VLX-Seek 1.5的FP/GT为18,而LocateAnything-3B为71.3。

打开网易新闻 查看精彩图片

这意味着,在同等条件下,VLX-Seek 1.5能够显著减少错误目标判断。

它选择了一条不同的智能路线:不强行给答案,且在信息不足时,敢说「我不知道」。

拒绝识别,并不是模型变弱。恰恰相反,知道什么时候说不知道,反而才是智能走进真实物理世界的重要标志。

在安防机器人、无人机巡检等高可靠场景中,乱报警可比漏报危险得多。

融资、开源与商业化

融资、开源与商业化

资本对范式投票,往往比技术社区的判断更早。

Om AI联汇此次完成数亿元的融资,释放的信号很明确:资本市场开始为端侧原生范式定价。

类比云原生早期,投资人押注的,也不是某一款PaaS产品,而是范式迁移本身。

而Om AI联汇要做「定义标准」的那个。

这与Kubernetes的逻辑一致:不靠售卖标准赚钱,靠免费把标准做成行业共识。

当全行业都遵循这套标准,定义方的云基础设施、托管服务就获得巨大商业增益。

目前,VLX-Seek 1.5的这套能力已向开发者开放。

当越来越多的开发者接入VLX-Seek 1.5,这套模型在更多真实场景被验证,数据反馈、持续迭代。

飞轮一旦转起来,生态位就稳了。

VLX-Seek 1.5开源,本质上是在争夺未来物理AI的基础能力标准的定义权。

除了模型本身,OmAI联汇也在基于VLX模型基座构建更大的端侧智能生态。

其「一脑多形」智能体平台OmAgent,试图推动AI走进物理世界。

在具身场景的商业化验证上,OttoPlex御行已经落地

打开网易新闻 查看精彩图片

消费端,OttoBox携手联想、苹果推出AI PC「OttoBox AI Studio」。

同时,其自研可穿戴AI视觉中枢Homer AI,已经服务全国近10万视障用户,平台月均AI调用达到千万次。

打开网易新闻 查看精彩图片

这些探索,表明Om AI联汇并不只是想成为一家模型公司,更希望成为端侧原生智能时代的基础设施提供者。

从云计算到云原生,产业真正的跃迁从来不是简单堆算力,而是找到更适合新世界的架构。

如今,物理AI也走到了类似节点。

融资,是资本对新路线的投票。开源,是生态对新范式的第一次接入。

当模型开始离开云端,进入千千万万个真实设备,端侧原生或许会成为物理AI走向规模化的关键答案。

下一场竞争,不只是大模型之争。

未来真正拥有最大价值的,也未必是参数最多的模型,而是那个让机器人、无人机和智能终端真正规模化运行的基础设施。