桃子桃子快讯
返回首页
工具

Noema 用模型分页技术在 iPhone 17 Pro 上跑通 Gemma 4 26B MoE

Noema 团队展示其「Overfit」模型分页系统,可在 iPhone 17 Pro 上运行 Gemma 4 26B…

2026.07.28 · 周二2 分钟阅读

Noema 创始人近日在 Hacker News 上发布了一项端侧推理演示:通过其自研的「Overfit」模型分页(model paging)系统,在 iPhone 17 Pro 上运行了参数规模为 26B、激活参数为 4B 的 Gemma 4 MoE 模型。作者明确披露自己是 Noema 团队成员,这本质上是一次带技术细节的产品自宣。

模型分页的核心思路

MoE(Mixture of Experts)模型的特点是总参数量大、单次推理只激活其中一小部分专家网络。Overfit 系统利用了这一点:把非路由的「常驻权重」保留在设备内存中,而将路由触发的专家权重按需从存储中读取。这样即便模型总参数量超出设备可用内存,也能在移动设备上完成推理,代价是首 token 延迟更高、生成速度更慢。

实测性能

作者给出的测试条件与结果如下:

  • 输入 prompt:699 tokens
  • Prefill 速度:约 34.4 tokens/s
  • Prefill 时长:约 20.34 秒
  • Decode 速度:约 3.5 tokens/s
  • 完整回答生成时间:约 6 分钟

作者同时强调,这一速度并不适合交互式、低延迟的聊天场景,其价值在于让受限设备在「答案质量比响应时间更重要」的场景下运行更强模型。同一套分页机制也可用于无法将完整模型装入统一内存的低内存 MacBook。

局限与定位

从性能数据来看,3.5 tokens/s 的解码速度意味着回答一个中等长度问题需要等待数分钟,与云端推理体验差距明显。该方案目前仍属于技术验证与小众应用,离实用化端侧 AI 助手还有距离。其潜在意义更多在于探索 MoE 模型在消费级硬件上的部署路径,而非直接可用的产品功能。

信源说明

本次分享来自 HN「Show HN」板块,作者本人即 Noema 团队成员,属于一手但带有自我披露的产品展示;评测数据由作者自行测量,未见第三方独立复现。技术文档与分页模型权重分别托管在 Noema 官网和 Hugging Face 上,可供进一步核查。

信源