桃子桃子快讯
返回首页
工具

Maple Preview 接入 Mference:M4 MacBook 上 500MB 内存跑 20B MoE

作者将三元精度训练的 20B MoE 模型 Maple Preview 集成进 Mference,在 MacBook A…

2026.08.10 · 周一5 分钟阅读

一名长期关注本地大模型推理的开发者近日在 Reddit r/LocalLLaMA 分享了一项实验:把 DeepGrove 团队发布的 Maple Preview 模型接入 Mference 推理框架后,在仅有 16 GB 统一内存的 MacBook Air M4 上,整套 20B(激活 1B)MoE 模型加载后仅占用 500–1,200 MB 内存,prompt 处理速度约 40 tokens/s,文本生成约 20 tokens/s。这一资源占用水平远低于常规本地推理方案,使模型可以常驻后台运行。

为什么要在 Mac 上「挤」模型

作者认为,理想中的边缘端模型应当足够「聪明」以调度外部数据,但又不必把所有知识都装进权重里——配合网页搜索与工具调用即可承担多数任务。为此,他梳理了三条降低本地推理内存占用的路线:

  • 小模型路线:前同事团队在 AIRI 发布的 Optimal Cognitive Core,基于 Qwen3-0.6B 与 Qwen3-1.7B 微调,专为 RAG 与外部上下文设计;BF16 权重分别仅 1.2 GB 与 3.4 GB,但参数规模过小,难以完成通用任务。
  • 量化路线:PrismML 的 Bonsai-27B 采用二值/三值量化 Qwen3-27B,三值版推理时约 7.2 GB,可在 Mac 上运行,但因是 dense 模型,生成速度预计仅 13–14 tokens/s,且量化过程未必保留多语种能力。
  • SSD 流式加载路线:turbo-fieldfare 及其 fork Mference 把 MoE 专家留在 SSD、按需流式读取,可在 2 GB 内存下运行 Gemma-4-26B 等大模型,代价是生成与 prompt 速度降至两位数 tokens/s。

Maple Preview:原生三元 MoE 的设计取舍

Maple Preview 由 DeepGrove 发布的 20B A1B MoE 模型,从架构设计阶段就以「Mac 本地高效推理」为目标,并从头以三元精度(ternary precision)训练,而非在现有 FP/BF16 模型上做后量化。这一选择带来几个直接结果:

  • 模型权重约 5.31 GB,搭配 131K 上下文后总占用约 7.5 GB,比 Bonsai 的二值量化版本小近 1.5 倍。
  • 在 M4 Mac Mini 上据称可达到 218 tokens/s 生成速度;在 iPhone 上约 127 tokens/s(具体型号未注明)。
  • 模型仅在英语上做了充分训练,其他语言能力与世界知识均较弱,例如会混淆「Psycho Mantis」出自哪款游戏。

在工具调用方面,DeepGrove 并未公布 benchmark;作者使用 Qwen3-235B-A22B-Instruct-2507 作为用户模拟器,自行运行了 Tau-2 测试,结果为:

  • Airline:0.48
  • Retail:0.175
  • Telecom:0.427

成绩远不及 Claude Sonnet 或 Qwen 系列,但作者强调这只是 Preview 版本,作者明确表示后续会针对 agent 工作负载继续训练。

接入 Mference 后的实测结果

Mference 是 turbo-fieldfare 的 fork,原生支持 Qwen3-25B、DeepSeek V4 Flash、Inkling-Small 276B 等模型的 SSD 流式加载。作者的想法是:Maple Preview 架构本就为低内存环境优化,再叠加上 Mference 的专家流式读取,理论上有进一步压缩空间的余地。他借助 Codex 投入约 20 小时开发,在 Edgar Allan Poe《The Raven》的 teacher-forced top-10 tokens 一致性测试中追平了官方实现。

关键运行数据如下:

  • 内存占用:500–1,200 MB(随上下文长度变化)
  • Prompt 处理:约 40 tokens/s
  • 文本生成:约 20 tokens/s
  • 平台:MacBook Air M4(16 GB 统一内存)
  • 能力:可调用工具、可生成文本

适用场景与后续计划

作者将这类低资源模型的使用归纳为两种模式:

  • 交互式对话:追求低延迟与快速响应,需要把模型完整加载到内存。
  • 后台常驻任务:延迟不敏感,可稳定占用极少内存,适合做消息分类、知识图谱扩展、邮件过滤、摘要生成、缓慢网页研究等工作;当临时需要交互时,从 SSD 完整加载仅需数秒,体验接近无缝。

他表示后续会尝试把改动合并回上游 Mference 仓库,短期内读者可先使用其 GitHub fork 体验。整体而言,这是一次针对三元原生 MoE 模型与 SSD 流式推理框架的可行性验证,展示了在严格内存预算下运行 20B 级别模型的现实路径。

信源