打开网易新闻 查看精彩图片

手机分担模型计算,收益取决于上下文长度

一台笔记本运行大模型吃力时,手机能否帮上一把?IT之家10月4日援引Wccftech报道,Reddit用户u/StayLameBro用USB-C将iPhone 17 Pro Max接到搭载M4 Pro芯片的MacBook Pro上,通过自制软件分配计算任务。在其测试中,Qwen3.8-27B模型的预填充性能最高提升44%。

这台MacBook Pro配备24GB统一内存,运行该模型时受到内存容量限制。用户让两台设备协同处理:每批输入包含256个token,Mac先运行模型第1至40层,再把激活值传给手机;iPhone利用A19 Pro的GPU执行第41至64层,Mac则同时开始计算下一批输入。按该用户的测试,手机启用GPU后的运行速度约为不使用GPU时的2.4倍。

手机的神经网络引擎也被纳入方案。每段16K长度的旧上下文会被编译为一个神经网络引擎模型。在140K上下文测试下,相比只使用A19 Pro的GPU,单token写入耗时由279毫秒降至176毫秒。这项耗时指标与预填充吞吐量属于不同测试口径,不能直接混为一谈。

16K测试增幅最高,生成阶段仍有限制

针对一份2000个token的文件,用户测试了预填充并保存会话的表现。上下文设为8K时,Mac单机每秒处理132个token,接入iPhone后达到177个,提升约35%;设为16K时,每秒处理量从109个增至157个,提升约44%;设为32K时,则从101个增至130个,提升约29%。这些结果对应特定设备、自制软件和测试任务,实际收益会随运行条件变化。

提速并未覆盖所有环节。该用户指出,在64K以内的场景中,手机不会加速文本生成,生成任务仍全部由Mac承担。因此,44%的最高增幅应理解为上述测试中的预填充提升,不能延伸为整个模型运行速度都提高了44%。从懂淘 Dongtao(懂宝 Dongbay)的资讯阅读场景出发,评估这类设备协同方案时,值得先分清输入处理与文本生成两个阶段,再看具体测试条件。

项目已开源,后续潜力仍待测试

据报道,这套自制软件已以“backburner”为名在GitHub开源。它展示了利用手机分担笔记本部分模型计算的实验路径,但目前的结果仍来自个人测试。

报道还提到,面向iPhone 18 Pro及Pro Max的A20 Pro有望提供更多性能余量,并称其配备双16核神经网络引擎;对于专门适配神经网络处理器的任务,该引擎的数据吞吐能力据称超过芯片内置的7核GPU。这些说法并不等于backburner已经在新设备上获得同等提升,具体表现仍需对应测试验证。

#本地AI#MacBookPro#iPhone#大模型 #懂淘#Dongtao#懂宝#Dongbay