工具
NVFP4 KV 缓存在双 5060 Ti 上成功运行
用户在两张 RTX 5060 Ti 上借助 vLLM 跑通 NVFP4 KV 缓存,可运行 27B 级量化模型。
2026.07.21 · 周二约 3 分钟阅读
近日,Reddit r/LocalLLaMA 社区用户分享了一项本地推理技术成果:在两张 RTX 5060 Ti 消费级显卡上,借助 vLLM 推理框架成功启用 NVFP4 格式的 KV 缓存,并稳定运行 Qwen3 系列 27B 参数规模的量化模型。该方案依托 vllm-project 仓库 sm120-fixes 分支(commit f54446749)的 nightly 镜像完成,完整启动脚本与运行截图已在原帖公开,相关讨论见 GitHub issue #49011。
核心配置
- 镜像:localhost/vllm-sm120-fixes:nightly
- 模型:Qwen3.6-27B-PrismaSCOUT-Blackwell-NVFP4-BF16-vllm
- 量化与并行:--quantization compressed-tensors,--dtype bfloat16,--tensor-parallel-size 2
- KV 缓存:--kv-cache-dtype nvfp4,--max-model-len 262144,--gpu-memory-utilization 0.90(提到 0.94 会触发 MTP workspace buffer OOM)
- 卸载策略:--kv-offloading-size 20,--kv-offloading-backend native
- 调度参数:--max-num-seqs 4,--max-num-batched-tokens 4128,开启 prefix caching 与 chunked prefill
- CUDA Graph:--cudagraph-capture-sizes 1 2 4,PIECEWISE 模式(发帖者注明 FULL 模式会破坏 XQA,详见 issue #49010)
- 推测解码:--speculative-config {"method":"mtp","num_speculative_tokens":3}
运行环境与限制
为了在显存受限的消费级 GPU 上腾出工作空间,发帖者设置了多项环境变量:
- VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0:可回收约 0.39 GiB 给 MTP workspace
- VLLM_ALLOW_LONG_MAX_MODEL_LEN=1:允许更长的上下文
- NCCL_CUMEM_ENABLE=0、NCCL_P2P_LEVEL=PBX、VLLM_SKIP_P2P_CHECK=1:关闭 NCCL P2P 与 cumem 以规避兼容性问题
- VLLM_FLOAT32_MATMUL_PRECISION=high、OMP_NUM_THREADS=1:精度与线程设置
社区与复现说明
发帖者明确表示该方案并非原创,而是参考社区中他人描述的思路后,借助 opencode 与 GLM 5.2 工具直接复现并验证。对于希望在本机双 5060 Ti 上尝试长上下文 + 量化 KV 缓存方案的本地推理玩家,这套配置可直接作为起点参考,并根据实际显存情况进行微调。
