研究论文
FreeToken 论文:用消费级显卡本地部署前沿 MoE 大模型
arXiv 论文 FreeToken 提出带宽自适应执行与语义缓存,可在消费级显卡上以交互速度运行前沿 MoE 模型,号…
2026.08.25 · 周二约 2 分钟阅读
近日在 arXiv 上线的研究论文 FreeToken(编号 2608.16157)提出了一种面向边缘设备的 MoE 大模型推理方案,声称可在消费级显卡和工作站上以交互速度运行前沿 MoE 模型,且无需使用激进量化手段。
核心性能数据
论文给出了多款前沿 MoE 模型在消费级硬件上的实测吞吐数据:
- Qwen3.6 35B:搭载 8GB 显存的 RTX 4060 笔记本显卡,达到 39 tok/s
- DeepSeek-V4-Flash 284B:RTX 5090 台式机,22–25 tok/s
- GLM-5.2 753B:RTX PRO 6000 工作站,15 tok/s
作者还表示,使用同一组官方权重,用户可以在 Claude Code 或 Codex 等编程代理场景中以接近零成本的方式调用前沿模型。
技术思路
FreeToken 的核心是两条机制:
- 带宽自适应的 CPU–GPU 协同执行,根据模型层特性与硬件带宽动态调度计算
- 跨 agent 轮次的语义感知缓存,在多轮交互中复用历史计算结果
与 Ollama 的对比
按作者提供的数据,相较 Ollama,FreeToken 在解码阶段可实现 3–4 倍加速,预填充阶段可达 6–30 倍加速。需要指出的是,相关数据来源于论文作者及其在 X(原 Twitter)上的转述,独立复现结果尚待社区验证。
适用场景
该方案对希望在本地运行大型 MoE 模型的开发者具有参考价值,尤其适合显存受限的笔记本和单卡工作站场景。论文中列出的 Qwen3.6、DeepSeek-V4-Flash、GLM-5.2 等模型版本与实测环境,仍需以论文正文及官方仓库为准。
