桃子桃子快讯
返回首页
工具

老矿卡跑大模型:四块 GA100 64GB 实战测评

Reddit 用户实测 4 块 64GB 显存的 GA100 矿卡,列出 gpt-oss、Qwen3.6、DeepSee…

2026.08.12 · 周三5 分钟阅读

近日,r/LocalLLaMA 用户 m94301 发布了一项针对二手矿卡 CMP170HX 的本地大模型推理实测。该卡基于 GA100 核心(70 SM),单卡配备 64GB HBM2,HBM 带宽约 1215 GB/s。作者用 4 张 8GB 显存版本手动刷成 64GB,总显存达到 256GB,通过 PCIe Gen2 ×4 接口与主机相连,无 NVLink,功耗上限 150W。实测基于 llama.cpp,使用 -sm layer 分层卸载,所有数值为单流服务场景下的 token 生成(tg)与预填(pp)速度,KV 缓存默认 f16。

测试平台与配置

  • GPU:4 张 GA100 矿卡(GA100,70 SM),64GB HBM2,单卡 ~1215 GB/s 显存带宽
  • 接口:PCIe Gen2 ×4(约 1.6 GB/s),无 NVLink
  • 功耗上限:150W
  • 软件栈:llama.cpp,-sm layer 分层卸载,KV f16
  • 测量指标:单流 tg(token/s)、pp(prompt 处理 token/s)、最大上下文

作者表示,PCIe Gen2 ×4 并未构成瓶颈,仅在大模型加载阶段出现等待;NVMe 盘读取 550 MB/s 才能打满链路。整体功耗与噪音对小型工作站较为友好,单卡即可单独运行大多数中小模型。

单卡性能(64GB)

  • gpt-oss-20B(MXFP4 · 3.6B MoE):tg 120 t/s,pp 2000 t/s,上下文 131K;批处理可达 503 t/s,单流受启动开销限制
  • gpt-oss-120B(MXFP4 · 5.1B MoE):tg 78 t/s,pp 1244 t/s,上下文 131K,q8 KV;作者称为单卡下「最快的能写代码的模型」
  • Qwen3.6-35B-A3B(Q6_K +MTP · 3B MoE):tg 110 t/s,pp 1700 t/s,上下文 262K
  • Qwen3.6-27B(Q5_K_M · 25B dense +MTP):tg 47 t/s,pp 812 t/s,上下文 262K
  • gemma-4-31B(Q8_0 · dense):tg 23 t/s,pp 767 t/s,上下文 262K;Q8 量化在速度与质量上均优于 Q6_K

双卡扩展

  • gpt-oss-120B(MXFP4):tg 85 t/s,pp 1870 t/s,131K 上下文;相比单卡仅 +48% pp,tg 几乎持平
  • Laguna-S 2.1(Q4_K_M · 8B MoE):tg 59 t/s,pp 968 t/s,262K 上下文
  • GLM-4.5-Air(Q6_K · 12B MoE):tg 39 t/s,pp 1181 t/s,131K 上下文
  • Mistral-Medium-3.5 128B(Q4_K_XL · dense):tg 9.8 t/s,pp 200 t/s,262K 上下文;稠密模型超过 30B 后在该配置下速度过低

三卡与四卡

  • DeepSeek V4-Flash 0731(Q4_K_XL · 13B MoE + MLA):三卡 tg ~29 t/s,pp ~365 t/s,上下文可达 1M;四卡 tg 29 t/s,pp ~450 t/s,仍维持 1M 上下文
  • 同模型搭配 BF16 DSpark 投机解码草稿模型:四卡 tg 33 t/s,pp 400 t/s;代码任务 37 t/s,文本任务 28 t/s
  • MiniMax-M2.7(Q4_K_M · 10B MoE):三卡 tg 47 t/s,pp 1135 t/s,上下文 192K,比 IQ4_XS 版本 pp 提升约 29%

值得注意的是,DeepSeek V4-Flash + DSpark 草稿模型在 1M 上下文下无法稳定运行在三卡配置:VRAM 占用约 99%,在大预填时出现 OOM 崩溃;需要第 4 张卡才能完整支撑 1M 上下文,或将上下文限制在 512K–768K。

结论与建议

作者总结:若以 $200 左右的价格购入这些矿卡,性价比极高;若当前价格接近新型号,需权衡 GA100/Ampere 级别的性能与超大显存之间的取舍。对显存敏感、需要运行 100B+ 模型或多模型并行的本地用户而言,4 卡共 256GB HBM 仍是独特方案;但若追求更高的 tg/pp 速度,Hopper 或 Blackwell 仍是更优选择。

实测所用 GGUF 来自 unsloth、bartowski、lmstudio-community 与 poolside。部分模型在测试后因质量或更优替代被剔除,原文未保留其数据。

信源