桃子桃子快讯
返回首页
工具

社区定制内核把 Qwen3.5 35B A3B 推到 RTX 5060 Ti 上 55 tok/s

Reddit 用户通过 Gated Delta Network 自定义内核,在 RTX 5060 Ti 上以 float…

2026.07.24 · 周五2 分钟阅读

社区开发者 Azazelionide 近日在 Reddit 的 r/LocalLLaMA 板块发帖,宣称通过扩展某推理框架(俗称「garlic」)并引入 Gated Delta Network 自定义内核,在 RTX 5060 Ti 显卡上以 float8 量化运行 Qwen3.5 35B A3B(混合专家模型),实现了约 55 token/秒 的生成速度,明显高于 llama.cpp 在 Q8 量化下的同模型表现。作者强调这一结果尚未启用 MTP(Multi-Token Prediction,多 token 预测),后续还有进一步提速空间。

性能表现

根据原帖数据:

  • 启用屏幕录制时测得约 55 token/秒。
  • 关闭录制后可达约 61 token/秒,作者指出录制过程会占用 CPU 与 GPU 算力,导致测速偏低。
  • 作为对比,llama.cpp 在同等硬件下以 Q8 量化运行该模型时速度明显落后,原帖未给出具体倍数。

这一成绩是该作者上一轮工作的延续——此前他曾把 Qwen3-30B-A3B 推到 50 token/秒,本次将模型规模升级的同时还实现了提速,社区关注度较高。

技术要点

作者将性能突破归功于两类改动:

  • Gated Delta Network 自定义内核:针对模型中的 MoE 门控与 Delta 网络结构做了底层优化,绕开了通用 kernel 的效率瓶颈。
  • float8 量化:相比 Q8 量化进一步压缩显存与带宽占用,适配 RTX 5060 Ti 这类显存受限的中端显卡。

作者还特别提到,当前方案尚未开启 MTP。MTP 一次可并行预测多个 token,除「并行多 token」外还有若干作者未展开的增益点,因此理论上仍存在额外提速空间。

待跟进

作者表示正在撰写一篇博客文章,详细记录此次提速所用的优化技巧,旨在帮助其他本地推理玩家复现。考虑到「Qwen3.5 35B A3B」这一型号命名在公开资料中尚不常见,读者在尝试前宜先确认模型权重来源与对应配置,以免与已发布的 Qwen 系列混淆。

信源