桃子桃子快讯
返回首页
开源

Qwen3.8-27B 在 16GB 显卡上的量化与智能体实测

用户在 RTX 5060 Ti 16GB 上对比 jpetrina 与 Unsloth 两类 Qwen3.8-27B 量…

2026.08.22 · 周六6 分钟阅读

一名本地大模型社区用户在 RTX 5060 Ti 16GB 上对 Qwen3.8-27B 进行了为期数天的测试,目标不是单纯追求最高 tokens/sec,而是验证在单卡 16GB 显存上限内,能否同时满足较长上下文、稳定的工具调用、多轮行为以及视觉能力,从而支撑真正意义上的智能体工作流。测试还对比了此前在用的小模型 Qwen3.5-9B NVFP4,作为基线参考。

测试环境

  • 显卡:RTX 5060 Ti 16GB
  • 推理框架:llama.cpp build 10520,启用 Flash Attention,优先全 GPU 卸载
  • 单槽位、无并发,KV cache 使用 Q4_0
  • 对比模型:
    • jpetrina Qwen3.8-27B IQ4_XS-pure
    • Unsloth Qwen3.8-27B UD-IQ4_XS
    • Unsloth Q8_0(短上下文质量基线)
    • Qwen3.5-9B NVFP4(已有部署)

吞吐与显存

配置上下文视觉空闲显存短上下文生成
jpetrina IQ4_XS-pure, MTP-164K15,188 MiB46.9 tok/s
Unsloth UD-IQ4_XS, 无 MTP32K13,764 MiB27.4 tok/s
Unsloth UD-IQ4_XS, MTP-164K14,918 MiB45.6 tok/s
Unsloth UD-IQ4_XS, MTP-1, F16 mmproj64K15,680 MiB45.4 tok/s

Unsloth 的主 GGUF 已包含 MTP 张量,单独加载 MTP GGUF 会额外占用约 768 MiB,因此并不必要。在约 55K token 的填充上下文下,Unsloth 模型测得:

  • Prompt 处理:738.7 tok/s
  • Prefill 后生成:31.3 tok/s

64K 上下文在该卡上对交互式自主智能体具备可用性,但随着 KV cache 填充,速度会自然下降。

视觉能力

F16 视觉投影仪可正常工作,包括对报纸图像的 OCR 式读取,1024 个图像 token 的预算对该测试已足够。但 64K 上下文 + MTP + F16 投影仪同时加载时,空闲显存只剩 136–208 MiB,几乎触顶。因此建议拆分为两个 profile:

  • 文本智能体:64K 上下文 + MTP-1
  • 视觉任务:按需使用较小上下文单独加载

量化保真度

使用 16 条 WikiText-2 样本在 512 token 上下文下对比两种 IQ4 变体与保存的 Q8 logits:

量化方案Perplexity平均 KLD vs Q8同 top-token 率Log-PPL 相关性
jpetrina IQ4_XS-pure7.49580.0235992.11%99.51%
Unsloth UD-IQ4_XS7.37890.0180093.06%99.63%
Q8_0 基线7.3858

Unsloth 的 IQ4 量化结果与 Q8 极为接近,在这些低层级保真度指标上明显优于 jpetrina 的 IQ4 版本。

智能体与工具调用

模型BFCL 单轮BFCL 多轮Support 场景
Qwen3.5-9B NVFP456/10029/805/6
jpetrina Qwen3.8 IQ4 MTP-150/10040/806/6
Unsloth Qwen3.8 UD-IQ449/10038/806/6

所有模型均通过了额外的 8/8 原生工具调用冒烟测试。在更贴近真实场景的多轮支持工作流中,27B 模型表现明显更好,覆盖了变更前诊断、授权后重启与校验、依赖型工具调用、缺参澄清、提示注入抵抗,以及约 55K token 历史中的检索等任务。9B 模型在工具调用与推理上出现多次失败,且思维链过于冗长、消耗 token 较多;两个 27B 变体在这些场景下都能正确处理。有趣的是,9B 在 BFCL 单轮子集上得分反而更高,27B 的优势集中在有状态、多步骤的工作流,而非孤立的函数调用题。

结论

  • 在 16GB RTX 5060 Ti 上,Qwen3.8-27B IQ4 的实用甜蜜点是 64K 文本上下文 + MTP-1。
  • 短上下文生成约 45–47 tok/s;在约 55K token 的 prefill 后,生成仍可保持约 31 tok/s。
  • Unsloth UD-IQ4_XS 保真度最佳,在所测样本上近乎 Q8。
  • 更好的 perplexity 与 logit 保真度并不自动转化为更高的智能体得分。
  • jpetrina 的量化在多轮智能体评测中以 40/80 对 38/80 险胜,是当前的最佳选择;Unsloth 版本是强有力替代,在通用文本生成场景中可能更合适。
  • 视觉可用,但建议在 16GB 显卡上使用独立的小上下文 profile。
  • Q8 在该卡上无法做到全 GPU 运行,仅作为带部分 CPU 卸载的质量对照。

测试使用固定随机种子的小子集与本地用例,并非 BFCL 官方榜单提交;所有结果来自单卡、单推理槽位、无并发环境。

信源