工具
Gemma 4 26B MoE 模型借助分页机制在 iPhone 17 Pro 上跑通
Noema 团队演示将 Q4_K_M 量化版 Gemma 4 26B A4B 模型通过 SSD 分页方式在 iPhone…
2026.07.25 · 周六约 2 分钟阅读
近日,Noema 团队在 Reddit 的 r/LocalLLaMA 板块演示了一项端侧推理实验:将 Q4_K_M 量化后的 Gemma 4 26B A4B(总参数 26B、激活参数 4B 的混合专家模型)跑在 iPhone 17 Pro 上。帖子作者是 Noema 的创始人,因此演示本身也是其自家应用「Noema Overfit」的一次产品展示。
核心思路:MoE 分页换容量
这套方案的关键在于「模型分页」(model paging)。由于 iPhone 的内存无法装下整个 26B 参数模型,团队把模型拆成两部分处理:
- 非专家权重(non-expert weights)常驻内存(RAM);
- 专家权重(experts)在推理过程中按需从 SSD 读取。
这种做法的代价是首 token 时间(TTFT)和生成速度都会变慢,优势则是可以让远超设备内存容量的大模型在手机或低内存 MacBook 上运行。
实测性能数据
演示中输入提示词长度为 699 tokens,得到的性能数据如下:
- 预填充速度:34.4 tk/s
- 预填充总耗时:20.34 s
- 解码速度:3.5 tk/s
- 完整回答耗时:约 6 分钟
作者表示,对于准确性优先于响应速度的场景,这种方案仍然具备实用价值。该方法同样适用于内存较小的 MacBook。
局限与定位
从数据来看,3.5 tk/s 的解码速度距离可流畅对话仍有明显差距,更适合离线、批式、注重准确性的问答场景,而非实时聊天。需要指出的是,帖子本质上是 Noema 团队对其「Overfit」功能的宣传,模型权重也已发布在 Hugging Face(NoemaAI-labs/Noema-Overfit),相关产品页为 noemaai.com/overfit。
