桃子桃子快讯
返回首页
工具

NVFP4 KV 缓存在双 5060 Ti 上成功运行

用户在两张 RTX 5060 Ti 上借助 vLLM 跑通 NVFP4 KV 缓存,可运行 27B 级量化模型。

2026.07.21 · 周二3 分钟阅读

近日,Reddit r/LocalLLaMA 社区用户分享了一项本地推理技术成果:在两张 RTX 5060 Ti 消费级显卡上,借助 vLLM 推理框架成功启用 NVFP4 格式的 KV 缓存,并稳定运行 Qwen3 系列 27B 参数规模的量化模型。该方案依托 vllm-project 仓库 sm120-fixes 分支(commit f54446749)的 nightly 镜像完成,完整启动脚本与运行截图已在原帖公开,相关讨论见 GitHub issue #49011。

核心配置

  • 镜像:localhost/vllm-sm120-fixes:nightly
  • 模型:Qwen3.6-27B-PrismaSCOUT-Blackwell-NVFP4-BF16-vllm
  • 量化与并行:--quantization compressed-tensors,--dtype bfloat16,--tensor-parallel-size 2
  • KV 缓存:--kv-cache-dtype nvfp4,--max-model-len 262144,--gpu-memory-utilization 0.90(提到 0.94 会触发 MTP workspace buffer OOM)
  • 卸载策略:--kv-offloading-size 20,--kv-offloading-backend native
  • 调度参数:--max-num-seqs 4,--max-num-batched-tokens 4128,开启 prefix caching 与 chunked prefill
  • CUDA Graph:--cudagraph-capture-sizes 1 2 4,PIECEWISE 模式(发帖者注明 FULL 模式会破坏 XQA,详见 issue #49010)
  • 推测解码:--speculative-config {"method":"mtp","num_speculative_tokens":3}

运行环境与限制

为了在显存受限的消费级 GPU 上腾出工作空间,发帖者设置了多项环境变量:

  • VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0:可回收约 0.39 GiB 给 MTP workspace
  • VLLM_ALLOW_LONG_MAX_MODEL_LEN=1:允许更长的上下文
  • NCCL_CUMEM_ENABLE=0、NCCL_P2P_LEVEL=PBX、VLLM_SKIP_P2P_CHECK=1:关闭 NCCL P2P 与 cumem 以规避兼容性问题
  • VLLM_FLOAT32_MATMUL_PRECISION=high、OMP_NUM_THREADS=1:精度与线程设置

社区与复现说明

发帖者明确表示该方案并非原创,而是参考社区中他人描述的思路后,借助 opencode 与 GLM 5.2 工具直接复现并验证。对于希望在本机双 5060 Ti 上尝试长上下文 + 量化 KV 缓存方案的本地推理玩家,这套配置可直接作为起点参考,并根据实际显存情况进行微调。

信源