打开网易新闻 查看精彩图片

苹果手机和笔记本搭档跑大模型?还真有点意思。

Qwen3.8-27B是一款参数量适中、性能不俗的大模型,但是对显存与内存总量有较高的要求,常规PC很难满足。

比如M4 Pro处理器的MacBook Pro,只配备了24GB统一内存,运行该模型时的预填充(Prefill)速度会受到极大限制。

网友“StayLameBro”突发奇想,把模型计算任务拆分给iPhone手机和MacBook笔记本,利用二者的合力突破24GB统一内存的限制,实现了预填充的显著加速。

打开网易新闻 查看精彩图片

它将二者通过10Gbps带宽的USB-C接口和数据线相连,又利用了一款名叫backburner的开源软件。

在预填充阶段,MacBook Pro负责每个256-token批次的第1~40层运算,再把激活值(activations)传给手机。

iPhone利用A19 Pro处理器的GPU图形核心,继续运行第41~64层。

与此同时,MacBook开始处理下一批数据。

A19 Pro处理器的GPU搭载了矩阵运算单元,支持Metal 4张量运算,这让手机负责的后半段模型预填充速度,比单靠手机CPU/GPU快了大约2.4 倍。

在140K上下文长度下,相比单独使用A19 Pro GPU,单个token的写入耗时从279ms下降到了176ms,速度提升了约37%。

以下是在相同环境下,向智能代理会话预填充2000 token文档时,单独使用MacBook和加上iPhone的性能对比:

8K上下文:从132 token/s提高到177 token/s,提升35%。

16K上下文:从109 token/s提高到157 token/s,提升44%。

32K上下文:从101 token/s提高到130 token/s,提升29%。

48K上下文:从87 token/s提高到113 token/s,提升30%。

上下文达到和超过64K之后,手机的任务会切换:最旧的KV缓存页面转移到手机保存,MacBook完整运行全部64层。

对于每一个注意力层,手机会在GPU上对旧的KV做注意力运算,MacBook再把结果和自身计算部分合并。

同时,手机的神经网络引擎(Neural Engine)也没有闲着。每16K长度的历史上下文,会被编译成神经网络引擎模型,将KV键作为权重。

此外,开启一个全新的27K-token智能代理会话,原版llama.cpp冷启动需要245秒,优化之后只用MacBook也需要228秒,而接入手机后只需要168秒,提升约26%。

不过,这套方案也有一定的局限,尤其是在上下文在64K以内时,不会加速解码性能,这部分完全由MacBook负责。

只有上下文超过64K之后,手机才会参与到解码阶段,实际的生成速度最高达到了30 token/s。

另外,只有预填充的token量大于约512时,手机才会加入预填充运算。

在一次真实会话里,36次请求中有7次触发了手机参与,但这7次请求承载了约83%的token读取总量。

打开网易新闻 查看精彩图片

总的来说,即便只是一次简单的实验,也让我们看到了广阔的前景。

比如换成最新的iPhone 18 Pro Max手机和A20 Pro处理器、MacBook Pro和M6处理器,又会提升多少?

比如换成最新的DeepSeek V4.1-Flash、Qwen3.8-Flash-Next模型,效果会如何?

也有人提出猜想:未来iPhone、MacBook,会不会和内存、SSD一样,进入算力、存储紧缺的时代?