工具
社区开源引擎 Turbo-fieldfare:2GB 内存跑 Gemma 4 26B 量化版
Reddit 用户发布开源 Swift/Metal 推理引擎,可在仅 2GB 内存的 Mac 上加载 Gemma 4 2…
2026.07.30 · 周四约 2 分钟阅读
Reddit 社区 r/LocalLLaMA 出现一款名为 Turbo-fieldfare 的开源推理引擎,主打低内存占用:在 Apple Silicon Mac 上仅需约 2GB RAM 即可加载 Gemma 4 26B-A4B-IT 模型,官方对比的常规占用约为 14GB,压缩比接近 7 倍。该引擎基于 Swift 与 Metal 编写,针对 M 系列芯片做了专门的内存与计算优化。
性能表现
据提交者 minefew 提供的数据:
- 8GB 内存的 M2 MacBook Air:约 5–6 tok/s
- M5 MacBook Pro:约 31–35 tok/s
数字尚需在真实使用中复现验证,但 8GB 机型上接近实时的生成速度,对体验本地大模型是一个积极信号。
功能与定位
该项目不止是命令行推理,还附带:
- 与 OpenAI API 兼容的本地服务器
- 流式输出(streaming)支持
- 函数调用(tool-call)能力
这意味着用户可以直接将支持自定义 base_url 的客户端(如 Continue、Open WebUI、Cursor 等)指向本地 Turbo-fieldfare 实例,无需额外开发即可获得近似 Chat Completions 的接口体验。
注意事项
- 模型名称 Gemma 4 26B-A4B-IT 中的「26B-A4B-IT」疑似为 MoE 结构(总参数 26B / 活跃 4B)的指示变体,但其确切来源与官方性尚需确认。
- 帖子未附开源仓库链接,仅提交者描述,缺乏可复现的 benchmark 对比与方法说明。
- 内存与速度数字来自单一来源,未见独立测试。
整体来看,这是一个面向 Apple Silicon 极低内存场景的工程尝试,方向有价值,但读者应在看到正式仓库与第三方复现报告前,保持审慎态度。
