桃子桃子快讯
返回首页
工具

Qwen3.8-27B 双卡 3090 实测:DFlash2 推测解码跑出 218 tok/s

Reddit 用户用 2 张 RTX 3090 搭配 vLLM 与 DFlash2 推测解码,实测单请求解码达 218…

2026.08.19 · 周三3 分钟阅读

一名 Reddit 用户在 r/LocalLLaMA 分享了在 2 张 RTX 3090 上运行「Qwen3.8-27B」的实测结果,借助 vLLM 推理引擎与 DFlash2 推测解码(speculative decoding),单请求解码速度达到 218 tok/s。原作者也注明这是「自己拼凑出来的方案」,仍有进一步调优空间。

硬件与软件栈

测试环境基于消费级显卡搭建,主要配置如下:

  • GPU:2 张 RTX 3090,PCIe Gen4 x16/x16 通道直连,无 NVLink,使用打了补丁的 P2P 传输。
  • 功耗上限:220 W / 250 W(每张卡分别设置)。
  • 软件栈:裸金属部署 vLLM v0.26.1rc1,配合 AutoRound INT4 量化(group size 128)以及 DFlash2 草案模型。
  • 作者还推送了一组自定义 vLLM 改动,使其能够正常启动,仓库地址已附在原帖中。

原帖中提及「使用 Kimi K3 完成所有 vLLM 修复」,表述较为隐晦,实际含义未作进一步说明。

性能指标

测试采用 Club-3090 标准化基准套件 bench.sh,预热 3 次、正式测量 5 次,采样参数为温度 0.6、top_p 0.95、top_k 20。主要数字如下:

  • 单请求解码吞吐:218 tok/s(叙事 / Narrative 测试),120 tok/s(代码 / Code 测试)。
  • Prefill 速度:10k 上下文 1342 tok/s;90k 上下文 628 tok/s。
  • 推测解码参数:草案 token 数 7,平均接受长度 3.35,接受率 47.8%。
  • 端到端:整墙 TPS 117.7(叙事)/ 204.8(代码);TTFT 168 ms / 178 ms。

显存与上下文

在上述配置下,两张卡的峰值显存占用约为 22.3 GB/卡。上下文长度上限为 131k,其中 DFlash2 草案模型自身约占 13.5 GB 显存。

备注

「Qwen3.8-27B」并非通义千问已公开发布的官方型号命名,原帖未给出该模型的来源或权重链接;数字、补丁仓库与硬件细节均来自用户自报,尚未经第三方复现验证。对使用类似硬件的消费级玩家而言,这套「AutoRound INT4 + DFlash2 + vLLM 自定义补丁」的组合思路可作为参考起点。

信源