桃子桃子快讯
返回首页
工具

社区开源引擎 Turbo-fieldfare:2GB 内存跑 Gemma 4 26B 量化版

Reddit 用户发布开源 Swift/Metal 推理引擎,可在仅 2GB 内存的 Mac 上加载 Gemma 4 2…

2026.07.30 · 周四2 分钟阅读

Reddit 社区 r/LocalLLaMA 出现一款名为 Turbo-fieldfare 的开源推理引擎,主打低内存占用:在 Apple Silicon Mac 上仅需约 2GB RAM 即可加载 Gemma 4 26B-A4B-IT 模型,官方对比的常规占用约为 14GB,压缩比接近 7 倍。该引擎基于 Swift 与 Metal 编写,针对 M 系列芯片做了专门的内存与计算优化。

性能表现

据提交者 minefew 提供的数据:

  • 8GB 内存的 M2 MacBook Air:约 5–6 tok/s
  • M5 MacBook Pro:约 31–35 tok/s

数字尚需在真实使用中复现验证,但 8GB 机型上接近实时的生成速度,对体验本地大模型是一个积极信号。

功能与定位

该项目不止是命令行推理,还附带:

  • 与 OpenAI API 兼容的本地服务器
  • 流式输出(streaming)支持
  • 函数调用(tool-call)能力

这意味着用户可以直接将支持自定义 base_url 的客户端(如 Continue、Open WebUI、Cursor 等)指向本地 Turbo-fieldfare 实例,无需额外开发即可获得近似 Chat Completions 的接口体验。

注意事项

  • 模型名称 Gemma 4 26B-A4B-IT 中的「26B-A4B-IT」疑似为 MoE 结构(总参数 26B / 活跃 4B)的指示变体,但其确切来源与官方性尚需确认。
  • 帖子未附开源仓库链接,仅提交者描述,缺乏可复现的 benchmark 对比与方法说明。
  • 内存与速度数字来自单一来源,未见独立测试。

整体来看,这是一个面向 Apple Silicon 极低内存场景的工程尝试,方向有价值,但读者应在看到正式仓库与第三方复现报告前,保持审慎态度。

信源