桃子桃子快讯
返回首页
工具

社区开发者将 DeepSeek V4 Flash 移植至 RTX 4090D:重写 Blackwell 内核

Reddit 用户通过 Triton 重新实现 DeepGEMM、FlashInfer sparse-MLA、block…

2026.07.24 · 周五3 分钟阅读

一名来自 r/LocalLLaMA 社区的开发者 iSevenDays 宣布,通过自行重写一系列原本仅面向 Blackwell 架构优化的 GPU 内核,已成功在两块 NVIDIA RTX 4090D(共 96 GB 显存)的 Ada Lovelace 平台上运行 DeepSeek V4 Flash 模型,端到端推理速度达到约 105 token/s,较 llama.cpp 方案在并行 agent 工作流场景下提升 2–3 倍。

背景:Blackwell 内核的硬件壁垒

DeepSeek V4 Flash 的官方推理栈依赖 DeepGEMM、FlashInfer sparse-MLA、block-scaled FP8 等深度优化内核,这些实现均基于 Blackwell 架构(SM100)编写。Ada 架构(SM89)缺乏对应实现,社区此前尝试在 RTX 6000 Blackwell 上达成 160 t/s 的成绩无法直接复用到 4090D 上。iSevenDays 表示,因此他与 AI 协作将上述 Blackwell 专属内核逐个用 Triton 重写,以适配 SM89 指令集。

实现要点:Triton 内核重写 + vLLM 定制分支

为了让 V4 Flash 在 96 GB 显存中可用,作者同时对模型进行了约 IQ2 级别的极致量化,首次压缩耗时可达 60 分钟。推理侧他并未使用主分支 vLLM,而是基于自建分支 vLLM-Moet 构建了 SM89 专用 Docker 镜像(v0251),并启用 p2p patch 以打通两块 4090D 之间的点对点通信。

关键启动参数如下:

  • 启用 MTP_TOKENS=1、FORCE_RESIDENT=1,并固定每卡 MEM_GB=28;
  • 张量并行度 TP=2,GPUS 限定 device=0,1;
  • 上下文长度可扩展至 262k,并发能力优于 llama.cpp。

如仅单卡运行,可将 TP 改为 1 并将 GPUS 限定为 device=0。

性能对比与局限

在同硬件的 llama.cpp 主分支 + 相关 PR(#21067)下,作者使用 DeepSeek-V4-Flash-IQ2XXS-w2Q2K 量化版本,将模型全量放入显存,启用 --split-mode layer、-fa、q8_0 KV cache 等配置,能够稳定跑满 262k 上下文,但并发吞吐受限。作者认为,若想获得 vLLM 的完整调度收益,目前几乎只能采用其 Triton 重写方案。他还表示对结果「99% 确信仍有进一步优化空间」。

小结

该工作展示了在缺乏原生 Blackwell 内核支持的 Ada 消费级硬件上,通过 Triton 重写关键算子来运行新一代 DeepSeek 模型的可行路径,为预算有限但持有双 4090D 的本地推理爱好者提供了参考方案,但其适用面仍局限于特定硬件与定制镜像,尚未形成即插即用的官方支持。

信源