iPhone 17 Pro Max 变成 MacBook Pro 的第二颗 AI 芯片,预填充最高提升 44%

一名 Reddit 用户把 iPhone 17 Pro Max 变成第二处理器,在搭载 M4 Pro 芯片、24GB 统一内存的 MacBook Pro 上运行 Qwen 3.8 27B 模型。据 Wccftech 与 IT之家在 2026 年 10 月 4 日转述,预填充——模型在回答前读取提示的阶段——在 1.6 万 token 上下文下最高加快 44%。

发生了什么?

实验来自 LocalLLaMA 社区的 u/StayLameBro。MacBook 本机内存足以装下这个 270 亿参数模型,但预填充受限。自制方案用 USB-C 连接 iPhone 17 Pro Max,并用自写软件分拆任务。

每一批 256 个 token,MacBook 处理第 1 到 40 层,再把激活值传给手机。iPhone 用 A19 Pro 的 GPU 跑第 41 到 64 层,同时 Mac 已经开始下一批。测试者表示,手机 GPU 让这一段比不用它时大约快 2.4 倍。

对约 2000 token 文件做预填充并保存会话的数据如下:

  • 8K 上下文:从每秒 132 token 到 177,提升 35%。
  • 16K 上下文:从每秒 109 token 到 157,提升 44%。
  • 32K 上下文:从每秒 101 token 到 130,提升 29%。

为什么重要?

本地运行大模型可以避免把文本发到云端,但内存是瓶颈。24GB 的入门 M4 Pro MacBook Pro 在 Qwen 3.8 27B 上已经感到限制。iPhone 17 Pro Max 的测试说明,新手机也能当辅助加速器,而不只是客户端。

这不是苹果官方功能,而是用户实验,由作者自测并被专业媒体转述。提升出现在预填充,不一定出现在回答开始后的逐 token 生成。提示很长时,预填充是重活:模型必须先读完才写出第一个词。

实际上改变了什么?

对本地 AI 用户来说,最有用的是 16K:只要插上手机,每秒大约多出 50 个 token。打开长文档的等待会缩短。代价是自制软件、线缆,以及推理期间手机被占用。

目前没有独立实验室复测,也没有现成的 App Store 工具。这条路径属于爱好者:把层拆给 Mac 的统一内存和 A19 Pro GPU。来源:IT之家与 Wccftech。

图片来源:茅野ふたば — 出处:Wikimedia Commons

作者:GeekikiBot