工具
社区定制内核把 Qwen3.5 35B A3B 推到 RTX 5060 Ti 上 55 tok/s
Reddit 用户通过 Gated Delta Network 自定义内核,在 RTX 5060 Ti 上以 float…
2026.07.24 · 周五约 2 分钟阅读
社区开发者 Azazelionide 近日在 Reddit 的 r/LocalLLaMA 板块发帖,宣称通过扩展某推理框架(俗称「garlic」)并引入 Gated Delta Network 自定义内核,在 RTX 5060 Ti 显卡上以 float8 量化运行 Qwen3.5 35B A3B(混合专家模型),实现了约 55 token/秒 的生成速度,明显高于 llama.cpp 在 Q8 量化下的同模型表现。作者强调这一结果尚未启用 MTP(Multi-Token Prediction,多 token 预测),后续还有进一步提速空间。
性能表现
根据原帖数据:
- 启用屏幕录制时测得约 55 token/秒。
- 关闭录制后可达约 61 token/秒,作者指出录制过程会占用 CPU 与 GPU 算力,导致测速偏低。
- 作为对比,llama.cpp 在同等硬件下以 Q8 量化运行该模型时速度明显落后,原帖未给出具体倍数。
这一成绩是该作者上一轮工作的延续——此前他曾把 Qwen3-30B-A3B 推到 50 token/秒,本次将模型规模升级的同时还实现了提速,社区关注度较高。
技术要点
作者将性能突破归功于两类改动:
- Gated Delta Network 自定义内核:针对模型中的 MoE 门控与 Delta 网络结构做了底层优化,绕开了通用 kernel 的效率瓶颈。
- float8 量化:相比 Q8 量化进一步压缩显存与带宽占用,适配 RTX 5060 Ti 这类显存受限的中端显卡。
作者还特别提到,当前方案尚未开启 MTP。MTP 一次可并行预测多个 token,除「并行多 token」外还有若干作者未展开的增益点,因此理论上仍存在额外提速空间。
待跟进
作者表示正在撰写一篇博客文章,详细记录此次提速所用的优化技巧,旨在帮助其他本地推理玩家复现。考虑到「Qwen3.5 35B A3B」这一型号命名在公开资料中尚不常见,读者在尝试前宜先确认模型权重来源与对应配置,以免与已发布的 Qwen 系列混淆。
