工具
RTX 3090 单卡优化 Qwen3 28B 推理,单请求达 82 tps
开发者针对 RTX 3090 单卡优化 Qwen3 28B 级模型推理,单请求 82 tps、峰值 672 tps,质量…
2026.08.17 · 周一约 3 分钟阅读
一位开发者针对 RTX 3090 单卡发布了一款针对 Qwen3-28B 级别模型(项目命名为 Qwen3.8-27B)的推理优化方案,声称在多种并发规模下较 vLLM 默认部署快 17%–149%。整套引擎已在 GitHub 开源,需配合 vLLM 与若干补丁使用。
性能数据
在 250W 功耗封顶的 RTX 3090 上,作者报告的关键指标如下:
- 单请求生成速度:82 tokens/秒
- 64 并发持续吞吐:417 tokens/秒
- 峰值吞吐:672 tokens/秒
- 上下文长度:理论上 195k tokens,仓库默认以 150k 发布以保证稳定性
按作者自述,在不同并发规模下,速度比参考引擎(原文中写作 "ninfer",疑似指某种同类推理框架或为笔误)快 17% 到 149% 不等。
优化路径
核心思路是分层量化叠加,逐步压低显存并拉长可承载的上下文:
- W4A16(权重 4 比特、激活 16 比特)量化:模型占显存 16.8 GB,KV 缓存约 66k tokens
- 叠加 fp8 KV 缓存:显存仍为 16.8 GB,缓存扩至约 155k tokens
- lm_head 改为 int8:显存降至 15.4 GB,缓存约 192k tokens
- embed_tokens 也改为 int8:显存降至 14.2 GB,缓存约 200k tokens
最终方案在 14.2 GB 显存下可承载约 20 万 tokens 上下文。整套栈基于 vLLM 构建,并打了若干补丁以保证 W4A16 路径稳定运行。
取舍与限制
作者报告的整体质量损失约为 0.6%(一次往返测试)。当前仅在 Linux 下完成验证,理论上可在 Windows 上工作,但未做实测。仓库中包含补丁与构建说明,作者称配置流程 "比 vLLM 默认部署更易上手",但属于主观感受,未给出系统化对比。
适用场景与注意点
这一项目对只有单张 RTX 3090(24GB 显存)的本地玩家较为友好——把 200 亿参数级别模型与近 20 万 tokens 上下文压进 14GB 左右,是降低消费级显卡部署门槛的有益尝试。但需要注意的是:模型名称在标题(Qwen3.8-27b)与正文(Qwen3.6-28B)之间不一致,基准对比方法与 "ninfer" 指代对象均来自作者自述,尚未见第三方独立复现。
