桃子桃子快讯
返回首页
工具

Gemma 4 26B MoE 模型借助分页机制在 iPhone 17 Pro 上跑通

Noema 团队演示将 Q4_K_M 量化版 Gemma 4 26B A4B 模型通过 SSD 分页方式在 iPhone…

2026.07.25 · 周六2 分钟阅读

近日,Noema 团队在 Reddit 的 r/LocalLLaMA 板块演示了一项端侧推理实验:将 Q4_K_M 量化后的 Gemma 4 26B A4B(总参数 26B、激活参数 4B 的混合专家模型)跑在 iPhone 17 Pro 上。帖子作者是 Noema 的创始人,因此演示本身也是其自家应用「Noema Overfit」的一次产品展示。

核心思路:MoE 分页换容量

这套方案的关键在于「模型分页」(model paging)。由于 iPhone 的内存无法装下整个 26B 参数模型,团队把模型拆成两部分处理:

  • 非专家权重(non-expert weights)常驻内存(RAM);
  • 专家权重(experts)在推理过程中按需从 SSD 读取。

这种做法的代价是首 token 时间(TTFT)和生成速度都会变慢,优势则是可以让远超设备内存容量的大模型在手机或低内存 MacBook 上运行。

实测性能数据

演示中输入提示词长度为 699 tokens,得到的性能数据如下:

  • 预填充速度:34.4 tk/s
  • 预填充总耗时:20.34 s
  • 解码速度:3.5 tk/s
  • 完整回答耗时:约 6 分钟

作者表示,对于准确性优先于响应速度的场景,这种方案仍然具备实用价值。该方法同样适用于内存较小的 MacBook。

局限与定位

从数据来看,3.5 tk/s 的解码速度距离可流畅对话仍有明显差距,更适合离线、批式、注重准确性的问答场景,而非实时聊天。需要指出的是,帖子本质上是 Noema 团队对其「Overfit」功能的宣传,模型权重也已发布在 Hugging Face(NoemaAI-labs/Noema-Overfit),相关产品页为 noemaai.com/overfit。

信源