IT之家 10 月 4 日消息,Qwen3.8‑27B 是一款性能不错的人工智能模型,但前提是设备拥有足够的显存与系统内存。搭载 M4 Pro 芯片的 MacBook Pro 仅有 24GB 统一内存,在运行该 AI 模型时,预填充速度会因此受到限制。据 Wccftech 报道,有一名用户通过 USB‑C 接口将 iPhone 17 Pro Max 外接至这台便携 Mac 电脑上,并借助自制软件,使得该 AI 模型的预填充性能最高提升了 44%。
IT之家注意到,为突破这台 Mac 24GB 统一内存的上限,Reddit 用户“u/StayLameBro”采用两种方式,把运算任务拆分交给 Mac 本机和 iPhone 17 Pro Max 协同处理。针对预填充加速,MacBook Pro 负责处理每一批 256 个 token 当中的第 1 至 40 层,再将激活值数据流传输到手机端;与此同时,iPhone 利用 A19 Pro 的 GPU 运行第 41 至 64 层,而 Mac 这边则已经开始处理下一批数据。依靠 GPU 运算,手机端的运行速度相比不使用 GPU 时提升约 2.4 倍。
整套方案里,神经网络引擎也没有闲置。每 16K 长度的旧上下文会被编译为一套神经网络引擎模型。在 140K 上下文长度下,相较于仅使用 A19 Pro 的 GPU,单 token 写入耗时从 279 毫秒缩短至 176 毫秒。拿将一份 2000token 的文件预填充并保存会话这项任务来看性能表现:上下文设为 8K 时,仅靠 Mac 本机的速度是每秒 132 个 token;外接 iPhone 之后达到每秒 177 个 token,性能提升 35%。上下文设为 16K 时,速度从每秒 109 个 token 上涨至每秒 157 个 token,增幅高达 44%。
当上下文窗口设置为 32K 时,预填充速度从每秒 101 个 token 提升至每秒 130 个 token,性能改善 29%。把 iPhone 17 Pro Max 外接在 M4 Pro 版 MacBook Pro 上,使用这套自制软件,按理可以得到十分出色的预填充速度。可惜正如这名 Reddit 用户指出的,现实并没有这么美好,这套方案还存在若干局限。举例来说,在 64K 以内的场景,手机并不会加速文本生成,文本生成的工作依旧全部交由 Mac 完成。
另外值得一提的是,驱动 iPhone 18 Pro 以及 iPhone 18 Pro Max 的 A20 Pro 芯片有望提供更大的性能余量。一方面它本身的整体性能更强;另一方面它配备双 16 核神经网络引擎。据称,针对专门适配神经网络处理器的任务,这款引擎的数据吞吐能力甚至超过该系统级芯片内置的 7 核 GPU。这套自制软件目前已经开源,可以在 GitHub 上下载,项目名称叫作“backburner”。
即便仅仅作为一项实验,也能够看出预填充速度提升带来的收益相当可观。后续自然还有继续挖掘性能潜力的空间;不过这或许也意味着,未来 iPhone 这类设备也有可能步入和内存、固态硬盘一样的供货紧缺阶段。
热门跟贴