梦瑶 发自 凹非寺

量子位 | 公众号 QbitAI

AI发展到今天,一个越来越扎心的事实是——

对于手机这个终端设备来说,AI能力更强,并不意味着用户「体验更好」。

一条航班延误通知弹出来,AI当然可以总结内容、回答晚点多久。

但真要继续往下处理,事情立刻复杂起来:转机要不要改、酒店会不会受影响、明早的会议还能不能赶上,一箩筐任务需要解决。

更麻烦的是,它还未必记得你的习惯:你愿不愿意坐凌晨的航班、在不在意多花几百块、第二天那场会到底能不能迟到。

想要在手机上vibe个应用程序,还要考虑接口、MCP等各种问题。

于是我们会发现如今的AI,好像什么都会一点,但真遇到事情,最后经常还是得自己动手。

打开网易新闻 查看精彩图片

△AI生成

这也解释了AI手机这两年越来越明显的一层落差:

模型能力一路上涨,Benchmark卷得飞起,但手机端体验却并没有随着模型变强自动升级。

一台手机想真正替用户把事情接过去,光听懂一句话远远不够。

它还得在用户授权和隐私保护的前提下,看懂你此刻发生了什么,记得此前发生过什么,再调动合适的模型、上下文、App和服务,把后面的事情一环接一环做完。

到了这一步,手机面对的已经不只是一道模型能力题,而是一道关于感知、记忆、调度、执行和协同的系统题。

打开网易新闻 查看精彩图片

就在刚刚结束的2026 vivo开发者大会(后简称VDC)人工智能分会场上,vivo给出的技术路径,也恰好切中了这一轮个人智能落地的核心命题:

以「大模型+Harness」构建个人化智能底座,重构OS体验。

让AI个人助理更好地为人所用,让系统更智能好用,也让手机真正开始理解用户本身。

一套端云模型矩阵,构建个体专属AI助理

今天再聊Agent,有一个词几乎已经绕不开:端侧。

Counterpoint Research预测,今年生成式AI手机出货占比将达到45%,去年这一数字还是36%。

AI兜兜转转几年,手机又一次站到了风暴眼。

原因很朴素直接,在所有终端里它离人足够「近」,也掌握着最完整的个人「上下文」。

屏幕里正在看的内容、相册、位置、应用使用习惯、长期积累的个人信息,都天然围绕这块几英寸的屏幕发生。

但技术史上有个很常见的规律:那就是一种技术离真实世界越近,约束往往越多。

当AI真正进入个人设备,时延、成本、隐私和能力,也开始被压进同一道选择题——

复杂推理和长链路任务需要更强的模型,却伴随着更高成本和响应时间;本地小模型足够快、足够轻,能力上限又更早出现,更麻烦的是,一项真实任务经常横跨两端。

过去那种一个模型包打天下的法子,有点行不通了。

打开网易新闻 查看精彩图片

△AI生成

类似的问题,芯片行业其实早就遇到过一次。

计算任务越来越复杂之后,单靠CPU承担所有工作,很快撞上功耗、效率和性能的天花板。

最后跑出来的答案,是异构计算

CPU负责通用控制,GPU接管并行计算,NPU专门处理AI,ISP则负责图像,系统根据任务不同,把计算动态分配给最合适的单元。

也就是说,不是让最强的单元干所有活,而是让最合适的单元干最合适的活。

到了端侧模型这事儿上,vivo也给出了一个很「终端厂商」的解法——

相较于大多数大模型厂商不断训练一个更强更通用的AI而言,vivo更关心的是,如何给每个人在手机上组织出一套属于自己的AI。

既然一个模型无法平衡所有能力,那不如让多个模型各司其职和自动调度,实现端云协同。

打开网易新闻 查看精彩图片

△AI生成

今年VDC人工智能分会场上亮相的「蓝心大模型端云矩阵」,本质上做的就是这个事情。

识别声音,到理解语义、语气和意图,交给端到端语音大模型BlueLM-Realtime;需要长期驻留在设备上的感知和记忆,由端侧大模型BlueLM-Nano承担。

信息查询、日程管理、跨App操作这类高频场景,则交给能快速执行任务的云侧模型BlueLM-Flash;碰到复杂推理、长程规划,则交给BlueLM-Pro接手。

此外,进入专业领域后,系统还能继续自动调动外部顶尖模型补位。

于是,模型也开始组团,从一个需要用户主动选择的产品,退到后台成为被系统自动调度的基础能力。

打开网易新闻 查看精彩图片

但问题是,一个长期运行在个人设备上的智能体,还会遇到第二道更难的题——

人,本身就是一种「不断变化」的上下文。

AI真正要理解的,从来不是一条孤立的指令,而是一个人此刻所处的状态,以及此前一路留下来的轨迹,它需要懂当下也需要懂过去。

随之而来的,还有另一道更棘手的问题:隐私和权限边界。

个人AI想越用越懂你,就得持续感知设备上的信息,并逐渐积累日程、位置、操作习惯、历史任务等个人上下文。

但感知范围越广、记忆时间越长,涉及的个人信息也越多,权限管理和隐私保护的压力自然会同步上升。

因此,个人AI真正难的地方,其实是同时解决两件看似矛盾的事——

既让AI拥有足够连续的个人上下文,又让这些感知和记忆始终运行在明确的授权边界之内。

围绕这个问题痛点,vivo则把目光押在两个关键词上:「感知」和「记忆」。

在用户授权和隐私保护前提下,把一次次零散的端侧交互,慢慢拼成对一个人的长期理解。

面向感知,端侧模型BlueLM-Nano通过轻量视觉编码器和UI专用Token,高效理解屏幕、图像、视频和文本;面向记忆,则通过SwiftKV、混合稀疏注意力和PLE逐层嵌入,将端侧上下文扩展至32K。

感知不断沉淀为记忆,记忆又让下一次服务更贴合你个体需求,一套越用越懂人的个人智能飞轮,也开始跑起来。

打开网易新闻 查看精彩图片

当一个AI能够看懂你此刻在做什么,记得你过去做过什么,又能在不同任务之间自动找到最合适的模型和能力,所谓个体专属AI助理,才真正开始有了个体二字的含义。

从模型能力到系统体验,Harness补上工程闭环

如果说模型能力解决的是会不会的问题,那么Agent真正进入系统之后,还要面对另一个更现实的事情:

AI能不能把一个任务,从头到尾自主地做完。

以前软件行业把这些统称为工程,Agent时代给工程重新起了个更时髦的名字:Harness。

但有意思的是同样叫Harness,大模型厂商和终端厂商真正要解决的问题,并不完全在一个层面。

对于大模型厂商来说,Harness更多围绕模型展开:怎么让一个Agent稳定调用工具、保持更长上下文、跑更久的任务,以及在Sandbox里安全执行。

到了手机这里,问题会再往系统深处走一层,难度也上了一个台阶:

手机面对的重点,是怎么让AI执行过去由用户自己完成的那套手机操作流程。

过去十几年,智能手机建立起来的是一套以App为中心的「服务秩序」。

打车要先找到打车软件,订酒店要打开旅行App,换句话说过去的手机系统,核心任务是让成千上万个App稳定地共享算力、存储、网络和硬件能力。

但Agent进入终端之后,虽然App依然承载具体服务,但用户与这些服务打交道的方式也开始发生「变化」:

Agent执行过程天然会穿透应用边界,连续调用不同服务、继承上下文,原本被App边界隔开的能力,开始需要在一次任务里被动态组合。

当越来越多Agent都要处理意图理解、服务调用和跨设备协同,这些能力就不该再被每个应用和开发者重复造轮子。

打开网易新闻 查看精彩图片

△AI生成

也正是在这套终端范式开始松动的过程中,vivo把其中一层关键能力,提前收进了手机系统,做出了一套「Agent原生的蓝心系统级Harness开发者平台」

把App时代的能力孤岛,改造成Agent时代的公共基础设施。

具体来说,感知和记忆层负责理解用户与环境,前者通过多模态信息获取当下状态,后者沉淀场景、偏好和历史交互,让不同Agent能够共享长期上下文。

规划层负责路由、任务编排和反思优化,并持续调整执行路径、Token和成本;执行层则借助6000+系统级工具,以及MCP、A2A、CLI和统一API,把模型、Agent、Skill和外部服务真正接进手机、IoT乃至现实世界。

由此,理解、规划、调用、执行也就形成了一个闭环,当底层的苦活被系统吃掉之后,开发者才终于能把时间花在真正值钱的地方。

打开网易新闻 查看精彩图片

此外,Harness还得解决一个Agent行业非常现实的问题:经验怎么留下来。

人干同一件事十次,多少会学聪明一点。

Agent今天绕八个弯完成任务,明天如果还原样绕八个弯,那它充其量是个拥有无限耐心的实习生。

而在vivo的这套系统级Harness中,这种「自进化」的能力也被进一步做成了一套具体运行机制。

基于观察—反思—沉淀框架,系统可以在用户授权下持续学习行为与反馈,并利用设备闲时复盘任务路径,把新的经验重新沉淀进系统能力。

与此同时,统一意图、跨设备Runtime和上下文随行,让任务可以在手机、PC和平板之间继续跑;MCP和A2A再负责让Agent、模型和工具接力。

这也意味着,个人AI长期积累的,开始从静态的用户信息,进一步延伸到动态的执行经验。

当系统层足够成熟,对于开发者而言,剩下只需要考虑一件事:just do it。

打开网易新闻 查看精彩图片

AI行业过去几年花了大量时间研究怎么降低Token成本。

到了Agent时代,另一项成本可能会越来越贵——协调成本。

放在当前这个时间节点看,协调成本也正在迅速变成一项显性的系统成本。

能力越多,调度、上下文、权限和执行链路就越复杂;模型能力越强,系统工程的重要性也随之上升。

最后真正决定体验的,依旧是那条越来越清楚的分工:模型决定能力上限,系统决定这些能力最终能够兑现多少。

让服务接得「进」,让生态长得「开」

让个性化服务接进来,让真实意图跑出去

互联网过去二十年的商业史,某种程度上就是一部「抢入口」的历史。

门户时代抢首页,搜索时代抢关键词,移动互联网抢桌面图标和App时长,超级App再把越来越多服务收进自己的围墙里。

但Agent开始出现之后,这套规则有些不适用了。

当用户只需要对AI说一句「帮我订一家川菜餐厅」,他已经不太关心背后打开了哪个App、调用了哪个服务。

App时代争的是入口,Agent时代开始争的是谁能更靠近「用户意图」。

这也是为什么今年从Cursor、Codex到GitHub Copilot,Skills、MCP等机制越来越往意图核心靠。

打开网易新闻 查看精彩图片

△AI生成

但在一众全球主流AI公司中,作为一家终端厂商,vivo在生态层给自己的定位,显得有些克制。

他们并不试图成为一个包办所有服务的全能选手,而是把自己放在了意图和服务之间,做一个「搭桥人」——

一头,连接具体的Agent服务;另一头,连接真实的用户需求。

蓝心小V升级到Pro模式之后,vivo试图做的,就是把这中间那层连接成本尽可能压低:开发者接入一次,能力就能被系统在不同入口中统一理解、调度和触达。

与此同时,Agent、Skills、MCP、原子技能乃至端侧模型,也被逐步纳入同一套能力底座。

意图服务的竞争单位,也开始从一个完整App,逐渐下沉到一项项可以被智能调度的能力。

这也意味着,移动互联网过去十几年建立起来的「App即服务边界」,开始松动了。

生态合作共建,开始长出真实立体的注脚

2008年,苹果上线App Store时,真正把iPhone变成智能手机平台的,其实是一批批第三方开发者。

从游戏到社交、打车、支付,这个应用商店的可用性很大程度上取决于外部服务能在这套系统里长出多少新的能力。

平台比的是连接效率,生态共建比的是协同深度。

真正能把生态做厚的,最终还是第三方伙伴有没有在里面跑出新的产品形态和真实结果。

而在这个事情上,一家头部终端厂商也长出了不少具体注脚——

民生服务场景,vivo联合支付宝重构终端服务形态,将能力拆为服务直达、服务执行和MCP Skill,让更多生活服务一句话办完。

本地生活领域,美团将吃喝玩乐等能力接入小V,通过Agent,串起原本分散的服务入口。

出行场景,深度联动高德地图,小V一句话即可完成导航、路线规划、生活服务与POI查询。

电商消费端,京东进一步打通跨App圈选、多模态识别、商品搜索到支付的完整链路。

在刚刚结束的VDC圆桌讨论上,围绕第三方生态,来自京东和支付宝的合作伙伴围绕各自与vivo的合作实践,分享了Agent服务在终端落地过程中遇到的真实问题,以及生态协同带来的新解法。

而这些,也正是终端生态从「把服务接进来」,继续走向「让服务真正跑起来」必须补上的一环。

打开网易新闻 查看精彩图片

当然,技术赋能到底有没有价值,还要看它是否照顾到那些容易被忽略的需求。

事实上从2021年发起「声声有息」公益计划至今,vivo也已经开放27项无障碍功能,覆盖超过110万残障用户。

其多模态手语大模型也基于8000多个国标词汇、100万段视频训练,从单个手势识别走向连续手语理解,并已用于实时翻译和手语学习。

当AI开始听懂那些过去常被系统遗漏的表达,所谓个人化智能,也就有了更有温度的意义。

打开网易新闻 查看精彩图片

△AI生成

今天,当整个行业再聊端侧、手机、模型和Harness,会发现几者之间的界限其实正在变得越来越模糊——

模型开始进入系统,系统开始接管执行,端侧负责理解和记忆,云端补足更复杂的能力。

但站在用户这一边,所有技术名词最后其实都会收敛成一个很简单的体验:

能不能真正懂我,能不能帮我办事。

真实生活从来都不是一道孤立的Prompt,它是一连串习惯、偏好、临时变化和前后关联的小事。

用户不需要知道背后跑的是端侧模型还是云端模型,也不需要理解Harness、MCP和A2A分别做了什么。

他只会慢慢发现,很多事情不用再从头解释,很多操作也不用再自己一层层点下去。

这或许就是「个人化智能」更实际的一层含义:AI开始从理解一条指令,走向理解一个具体的人。

vivo这次给出的大模型+Harness路径,最终要缩短的正是这段距离:让模型能力穿过系统工程,真正落到每一次具体的日常需求里。

手机,由此也不再只是一个装着AI的设备,而开始有点像一台属于「我」的专属助理。