桃子桃子快讯
返回首页
工具

三卡旧 GPU 跑 Qwen3 与 Gemma 量化模型:性能基准实测

r/LocalLLaMA 用户在 GTX 1080 Ti 加两张 P102-100 矿卡上,对 Qwen3 与 Gemm…

2026.07.26 · 周日4 分钟阅读

近日 Reddit r/LocalLLaMA 板块用户发布了一组本地大模型推理基准测试,使用一台搭载三块 NVIDIA 旧显卡、总显存约 31GB 的工作站,对 Qwen3、Gemma3 / Gemma4 系列以及 Llama 2 等多个 GGUF 量化模型进行了性能对比。测试环境基于 Kubuntu 系统和 llama.cpp 的 Ubuntu Vulkan 构建。

测试硬件配置

平台采用一块 NVIDIA GeForce GTX 1080 Ti(11GB)搭配两张 NVIDIA P102-100 矿卡(各 10GB),三卡合计 31GB 显存。处理器为 AMD Ryzen 5 3600,搭配 48GB DDR4 内存。

值得注意的是,P102-100 是源自矿卡的 GPU,与消费级显卡属于同代帕斯卡架构但产品定位不同,被爱好者改造用于本地推理。三卡均通过 Vulkan 被 llama.cpp 识别,但日志显示 fp16 / bf16 / fp4 均不支持,因此实测主要依赖整数量化路径。

测试模型与量化方案

用户覆盖了多个不同规模与量化精度的模型,包括:

  • llama-2-7b(Q4_0)
  • gemma-4-26B-A4B 的 Q4_K_XL / NVFP4 / Q6_K_XL 三个量化版本
  • gemma-3-27b-it(Q5_K_M / Q6_K_XL)以及 medgemma-27b
  • qwen3.6-35B-A3B 的 NVFP4 与 Q4_K_S 量化版本
  • qwen3-coder-30B-A3B 的 Q4_K_M 与 Q5_K_XL 量化版本
  • gemma-4-31B-it(Q4_K_XL)

基准结果摘要

测试指标为 llama.cpp 常见的 tg128(128 上下文文本生成)与 pp512(512 token Prompt 处理)速度,单位为 token/s。整理后的关键结果如下:

  • 7B 级别的 llama-2 Q4_0:tg128 约 59.99,pp512 约 527.69,速度最快。
  • qwen3-coder-30B-A3B Q4_K_M:tg128 约 75.01,pp512 约 152.04,是中等规模模型中表现较优的组合。
  • gemma-4-26B-A4B Q4_K_XL:tg128 约 48.14,pp512 约 174.53。
  • gemma-4-26B-A4B NVFP4:tg128 约 33.28,pp512 约 165.37,NVFP4 量化在 tg128 上反而低于 Q4_K_XL。
  • gemma-3-27b-it Q5_K_M:tg128 仅约 10.20,pp512 约 87.91,明显偏慢。
  • qwen3.6-35B-A3B Q4_K_S:tg128 约 50.48,pp512 约 161.85。
  • 三卡功率限制统一设置为 150W。

从数据看,Qwen3 MoE 系列在 Q4 量化下既能保持较高 tg128 速度,也维持了不错的 pp512 吞吐;而 Gemma3 27B 密集模型在该老硬件上生成速度明显受限。

局限与说明

这是个人玩家发布的横向对比,并非官方测试,存在一定局限:硬件组合极度小众(P102-100 矿卡并非普通用户能稳定获取);llama.cpp Vulkan 后端对该类老卡的支持可能仍有优化空间;不同模型版本与量化来源不一致,难以完全排除量化质量差异对速度的影响。

对于想在老一代 Pascal 显卡上做本地推理的爱好者,这份实测提供了一个粗略的吞吐量参考,但在选型时仍建议结合自身硬件做进一步验证。

信源