工具
4 张 RTX 3080 跑 Qwen3-27B 代码生成:69 tps 解码,成本约 2000 美元
Reddit 用户用 4 张 20GB 版 RTX 3080 在 Vast AI 上测试 Qwen3-27B 代码生成,…
2026.07.23 · 周四约 3 分钟阅读
Reddit 用户 starkruzr 在 r/LocalLLaMA 发布了一组硬件实测:用 4 张 20GB 显存的 RTX 3080 显卡,在云算力平台 Vast AI 上对 Qwen3-27B 进行代码生成负载测试,重点考察长上下文下的解码速度与预填速度。原帖配套提供了测试脚本与详细数据页面。
基准测试结果
测试在开启 MTP(Multi-Token Prediction)的情况下进行,主要数据如下:
- 解码速度:在接近最大(256K)上下文长度下,达到 69 t/s(tokens per second)。
- 预填速度:关闭 prompt cache 后,在最大上下文下降至 893 t/s。
- 作者提示,由于显卡被 Wattage-Capped(功率受限),实际表现可能还有进一步优化空间。
在原帖标题中,作者还提到该方案速度「甚至优于 4 张 5060Ti」,但正文未给出对应的对比数据。
硬件成本拆解
作者重点展示了这一方案在性价比上的吸引力,单台主机的核心成本大致为:
- 4 张 20GB 版 RTX 3080:约 1600 美元(单卡低至 400 美元)。
- 主板 + CPU + 64GB 内存组合:eBay 二手约 275 美元。
- 整机总成本:约 2000 美元。
作者认为,这一预算下用户基本可以在「少量量化、全精度 KV cache、无明显性能损失」的条件下运行 Qwen3-27B 这类稠密模型,适合用作代码生成专用工作站。
关于 Q6KXL 与 ngram 的讨论
在量化方案上,作者对比了 Q6KXL 与 ngram 的表现:
- Q6KXL 量化版本与全精度版本「几乎一致」的输出,让作者「对 Claude 给出的解释并不完全信服」。
- ngram 方案则让整体表现「变差」,但具体原因未被展开。
作者最终结论是,无论量化策略如何,这一组合「速度飞起且成本不高」,更适合看重生成速度的代码场景。
配置建议与局限
作者给出的可复现建议是:寻找一块支持 4 条 PCIe 3.0 x16 插槽的 X99 主板(eBay 上并不难找),搭配上述显卡即可组建一台「性价比野兽机」。
需要指出的是,该帖仅为个人硬件实测,方法学细节相对有限,且对比基线(4 张 5060Ti)缺少对应数据。模型名称「Qwen3-27B」在官方公开模型列表中并不存在,可能存在笔误或社区内部版本。读者在参考性能数据时,应结合自身硬件与推理框架(如 vLLM、SGLang、llama.cpp)做进一步验证。
