桃子桃子快讯
返回首页
工具

Qwen3.8-27B 在 RTX 3090 单卡推理优化至 124 tps

独立开发者通过推测解码、KV 缓存量化与算子改造,将 Qwen3.8-27B 在 RTX 3090 上的单请求速度推至…

2026.08.19 · 周三3 分钟阅读

独立开发者「iamMess」在 r/LocalLLaMA 发布最新一轮针对 Qwen3.8-27B 在单张 RTX 3090 上的推理优化成果。在不损失采样分布的前提下,单请求速度从两日前的 82 tps 提升至 124 tps(greedy 模式),默认采样下达到约 114 tps;64 路并发峰值仍维持在约 1,000 tps。

关键性能数据

  • 单请求速度:约 114 tps(默认采样)/ 约 124 tps(greedy),分别从此前 90 / 98 tps 提升
  • 并发吞吐:64 路并发下约 1,000 tps,与上一版持平
  • 关键特性:推测解码(speculative decoding)「by construction」等价,采样分布与无推测解码时完全一致
  • 显存覆盖:完整 262k 上下文在 RTX 3090 上可装下,长上下文「needle」检索正确至 240k

本轮新增的优化手段

本轮工作重点放在单请求场景,叠加了多项工程改造:

  • 自生成 draft 词表:用模型自身输出来统计 draft 词汇覆盖率,原 92% 网页文本词表在代码任务上仅覆盖 83%,每次 miss 都会强制拒绝;新方案把覆盖提升至 97.5%,使 greedy 速度从 98 tps 提升到 109 tps
  • GPTQ-int4 量化 lm_head 与 MTP 模块:基于模型自身 hidden states 校准,PPL 仅 +0.6%,GSM8K 不变,接受率不变,每步节省 1.8 ms;以「fast variant」形式提供下载(约 1 GB)
  • Split-KV Attention 核函数:针对验证步(verify step)改造。FlashAttention-2 仅在单 query decode 时分 KV,4 文档场景下只用满 3090 全部 82 个 SM 中的 24 个;新 Triton 内核在 1.5k 上下文提速 5 倍,16k 上下文提速 10 倍
  • 采样器改造:免排序 top-k/top-p、多块 softmax、draft 直接从目标模型的截断支持分布采样,使默认采样下额外提速约 4%
  • KVarN 4/2-bit KV 缓存移植至 vLLM 0.27.1:完整 262k 上下文可装下,needle 检索在 240k 正确,PPL 仅 +0.16%;代价是 100k 上下文下解码速度降低约 20%

复现与代码

作者同时提供了可复现脚本 bench/run_benchmarks.sh 与安装校验脚本 verify.sh,方便使用者对照数据并确认 patch 正确加载。

作者表示,这一版大概率是推理栈的最后一次更新,除非社区出现值得验证的新思路,否则将停止继续挖掘边际收益。

信源