你在手机上用AI助手问“帮我总结一下上周那三份合同”,等了两秒,它只回了一句“内容太长,请分段输入”。这不是模型不够聪明,是数据没来得及喂到它嘴边。

小米8月24日发布的玄戒O3芯片,加上长鑫刚量产的首发LPDDR6内存,要解决的就是这个问题。二者联合之后,端侧AI面临的三个核心瓶颈——算力空转、多任务AI进程被杀、长上下文窗口受限——被一条链条打穿,而这条链条的传导逻辑,收音机里三句话就能讲清楚。

打开网易新闻 查看精彩图片

发布现场展示的支持LPDDR6的相关介绍页面

带宽翻倍,让AI算力不再“等米下锅”

如果把手机上的AI推理过程比作一个巨型厨房,NPU算力就是那几个顶级厨师,内存就是送菜窗口。前代LPDDR5X+旗舰芯片的组合,厨房里十几个厨师火力全开,但送菜窗口每秒只能传76.9GB的数据,大厨们大部分时间叉着腰等菜,灶台空转。

玄戒O3搭配长鑫LPDDR6之后,这个窗口的峰值带宽直接拉到113.8GB/s,比前代提升了48%。送菜速度翻倍,带来的是端侧大模型参数加载速度直接提升45%,推理过程中NPU等待数据填补的空窗期大幅压缩。

打开网易新闻 查看精彩图片

访存时延也从玄戒O1的344-384纳秒动态时延压到了177纳秒,相当于从“下单到出菜半小时”变成了“出锅就上桌”。

用户拿到新机,问一句答一句的卡顿感会明显消失。

调度不打架,AI后台进程不再被“踢出群”

光有带宽还不够。手机是多任务并行设备,CPU、GPU、NPU、ISP同时在抢内存通道,前代方案里,AI后台进程经常被系统优先级高的任务挤掉内存资源,直接触发进程被杀——你刚让AI帮你算完一组数据切到微信回消息,回过头AI已经重启了。

玄戒O3这次搬出了两套硬件机制来解决这个问题。一是全局VIP优先级保障,把DDR内存纳入1毫秒级的实时资源管控,关键AI任务在所有等待环节获得最高优先级,简单说就是“插队卡”。

二是新增的内存智能预取单元,在L2缓存还没确认数据丢失时,就提前向LPDDR6发送预取指令,减少多任务场景下内存仲裁排队的等待时长。

打开网易新闻 查看精彩图片

玄戒O3芯片的多单元缓存组合架构示意

长鑫LPDDR6的24位双子通道架构,天然匹配了这套调度逻辑,多任务并发访问AI数据时,总线仲裁冲突大幅降低。

用户拿到新机当日就能体验到——AI挂后台不再被系统清扫掉。

内存多出3GB,百万字长文一口气读完

16GB物理内存的旗舰手机并不少见,但前代LPDDR5X平台下,系统和交换分区读写会吃掉大量可用空间,留给端侧AI大模型的独立内存经常捉襟见肘。长文档读取只能分段裁切,AI读到后半段忘了前半段,上下文断裂。

这意味着,一部手机可以原生支持最长100万Token级别的端侧大模型上下文窗口——科大讯飞9月1日开源的星火X2.5-4B端侧模型,已经原生支持百万级上下文,一份完整的产品售后手册、几十页的合同文件,不需要再分段裁切。

打开网易新闻 查看精彩图片

多款端侧大模型在不同测试集下的性能表现对比

边界在哪,哪些场景它解决不了

这三条链打完后,14B及以上未深度裁剪的全精度大模型,在手机无主动风冷散热条件下长时间连续运行,依然会触发玄戒O3的功耗降频机制,带宽增益会被打折扣。

同时并行文生图、实时语音转写、多窗口长上下文交互的全并发多模态场景,数据流量可能超出单颗LPDDR6的调度上限,实测性能远低于实验室单任务跑分结果。

但在这套组合覆盖的主流场景——7B以下端侧模型的日常问答、多任务AI挂载、百万字以内的长文档处理——它确实把此前端侧AI的最大痛点从“等数据”变成了“直接用”,核心背后的逻辑,是玄戒O3对LPDDR6从协议到通道到调度的原生适配,让硬件增量没有被通用系统调度吃掉。