桃子桃子快讯
返回首页
工具

v100-skinny 内核让 V100 跑 Qwen3 27B 接近 366 t/s

社区开发者针对 V100(SM70)定制 NVFP4 推理内核,Qwen3 27B 极致场景下可达 366 t/s,开源…

2026.08.12 · 周三3 分钟阅读

社区开发者 dnv2003 近日发布开源项目 v100-skinny,针对 NVIDIA V100(SM70 架构)定制了用于 NVFP4 权重格式的推理内核,并结合「深度推测解码」实现了在该旧款数据中心 GPU 上运行大模型的全新路径。项目代码已托管在 GitHub(dnv2003/v100-skinny)。

项目背景与核心思路

V100 发布于 2017 年,SM70 架构并不原生支持 NVFP4 这种通常面向 Hopper/Blackwell 等新一代 GPU 的低精度格式。dnv2003 在先前 v100s 相关工作的基础上,编写了一套针对 SM70 的瘦内核(skinny kernel),让 NVFP4 权重的解码路径在 V100 上也能获得极高效率。作者在标题中所引用的 366 t/s,是在多 token 预测(MTP)仅做提取(extraction)这一绝对最佳场景下得到的数字。

不同任务的吞吐表现

根据项目说明,实际可用性能随任务类型有所变化:

  • MTP 提取场景:约 366 t/s(标题数字,极端最优)
  • 结构化生成(如 JSON 输出):约 240 t/s
  • MTP 友好的代码生成(样板代码、模式化片段、HTML 等,k=7 旗舰配置):约 200 t/s

需要强调的是,标题数字是 best case 表现,含较多开发假设与限定条件,正式落地仍需结合具体推理框架与硬件环境评估。

「几乎免费」的深度推测解码

除了主路径加速,作者还实现了在 SM70 上的深度推测解码(deep speculation),并称之为「almost free」,即在已有 NVFP4 内核之上,额外开销很低。这意味着 V100 用户在保持原有吞吐的同时,可以借助推测解码进一步降低生成延迟。

适用范围与局限

v100-skinny 主要面向手头仍持有大量 V100 卡的本地推理与研究者社区,例如 r/LocalLLaMA 的爱好者群体。但需要注意的是:

  • V100 显存通常为 16GB 或 32GB,27B 级别模型仍需依赖 NVFP4 这类强量化才能装下;
  • NVFP4 在 SM70 上并非硬件原生支持,性能与能效与 Hopper/Blackwell 上的原生实现不可直接对比;
  • 项目仍处于早期阶段,作者在仓库中明确列出了多项 caveats,使用前建议阅读相关说明。

对希望在旧硬件上继续挖掘 LLM 推理潜力的开发者而言,v100-skinny 提供了一个值得关注的技术样本。

信源