工具
开发者为 V100 适配 SGLang,支持 Qwen 与 Laguna
Reddit 用户基于 SGLang 分支,自研 TileLang 版 FlashAttention 与算子,让 V10…
2026.07.27 · 周一约 3 分钟阅读
一名开发者在 Reddit 的 r/LocalLLaMA 板块分享了一项针对 NVIDIA V100 GPU(计算能力 sm70)的推理框架适配工作。由于 V100 架构较旧,已不在 SGLang、FlashInfer 等主流推理引擎的官方支持列表中,该作者通过 fork SGLang 并自研底层算子,让这套现代推理栈重新跑在了 4×V100 32GB NVLink 机器上。
主要工作内容
- 编写了基于 TileLang 的 FlashAttention 实现,发布为 Tilelang-FA-V100,用于在 sm70 上提供高效的注意力计算。
- 集成了开源量化算子 marlin-v100,为 V100 提供 INT4 权重反量化通路。
- 启用了面向 sm70 的 ungated FlashInfer 算子,填补官方未覆盖的内核空白。
- 在上述基础上让 Dflash(一种稀疏/差分注意力方案)兼容 Qwen3.5 / 3.6 系列模型。
- 同步加入了 Laguna S2.1 的推理路径,并尝试将 Dflash 移植到 Laguna,暂未成功。
性能与运行环境
作者在 4×V100 32GB NVLink 配置上给出粗略指标:Qwen 类模型可达到约 4000–6000 tokens/s 的 prompt 处理速度,以及约 100 tokens/s 的文本生成速度(仅 Qwen,未含 Laguna)。图片展示了实际运行的吞吐量截图,但未与 A100/H100 等硬件做横向对比。
可用性与局限
作者已将改动开源,并提供了 Docker 镜像,避免使用者重新编译。仓库与镜像地址如下:
- sglang-V100:https://github.com/haohervchb/sglang-V100
- Tilelang-FA-V100:https://github.com/haohervchb/Tilelang-FA-V100
- marlin-v100:https://github.com/zhinianqin/marlin_v100
需要指出的是,该项目仍属于个人分支性质的社区工程,并非 SGLang 官方主线进展,也未公布标准化的 benchmark 数据。对于仍持有 V100 集群、又想跑现代 Qwen 类模型的用户而言,这套方案具备一定参考价值;但对绝大多数面向 H100/A100 的开发者来说,实用意义有限。
