工具
Qwen3.8-27B 在 RTX 3090 单卡推理优化至 124 tps
独立开发者通过推测解码、KV 缓存量化与算子改造,将 Qwen3.8-27B 在 RTX 3090 上的单请求速度推至…
2026.08.19 · 周三约 3 分钟阅读
独立开发者「iamMess」在 r/LocalLLaMA 发布最新一轮针对 Qwen3.8-27B 在单张 RTX 3090 上的推理优化成果。在不损失采样分布的前提下,单请求速度从两日前的 82 tps 提升至 124 tps(greedy 模式),默认采样下达到约 114 tps;64 路并发峰值仍维持在约 1,000 tps。
关键性能数据
- 单请求速度:约 114 tps(默认采样)/ 约 124 tps(greedy),分别从此前 90 / 98 tps 提升
- 并发吞吐:64 路并发下约 1,000 tps,与上一版持平
- 关键特性:推测解码(speculative decoding)「by construction」等价,采样分布与无推测解码时完全一致
- 显存覆盖:完整 262k 上下文在 RTX 3090 上可装下,长上下文「needle」检索正确至 240k
本轮新增的优化手段
本轮工作重点放在单请求场景,叠加了多项工程改造:
- 自生成 draft 词表:用模型自身输出来统计 draft 词汇覆盖率,原 92% 网页文本词表在代码任务上仅覆盖 83%,每次 miss 都会强制拒绝;新方案把覆盖提升至 97.5%,使 greedy 速度从 98 tps 提升到 109 tps
- GPTQ-int4 量化 lm_head 与 MTP 模块:基于模型自身 hidden states 校准,PPL 仅 +0.6%,GSM8K 不变,接受率不变,每步节省 1.8 ms;以「fast variant」形式提供下载(约 1 GB)
- Split-KV Attention 核函数:针对验证步(verify step)改造。FlashAttention-2 仅在单 query decode 时分 KV,4 文档场景下只用满 3090 全部 82 个 SM 中的 24 个;新 Triton 内核在 1.5k 上下文提速 5 倍,16k 上下文提速 10 倍
- 采样器改造:免排序 top-k/top-p、多块 softmax、draft 直接从目标模型的截断支持分布采样,使默认采样下额外提速约 4%
- KVarN 4/2-bit KV 缓存移植至 vLLM 0.27.1:完整 262k 上下文可装下,needle 检索在 240k 正确,PPL 仅 +0.16%;代价是 100k 上下文下解码速度降低约 20%
复现与代码
作者同时提供了可复现脚本 bench/run_benchmarks.sh 与安装校验脚本 verify.sh,方便使用者对照数据并确认 patch 正确加载。
- 推理引擎仓库:https://github.com/syv-ai/qwen38-27b-rtx3090
- Fast variant 权重:https://huggingface.co/syvai/qwen3.8-27b-3090-fast-variant
作者表示,这一版大概率是推理栈的最后一次更新,除非社区出现值得验证的新思路,否则将停止继续挖掘边际收益。
