桃子桃子快讯
返回首页
开源

DeepSeek V4 Flash 在 128GB 锐龙 AI MAX+ 上跑到 32 tok/s

Lucebox 通过自研 ROCmFPX 量化与 DSpark 推测解码,将 284B 参数的 DeepSeek V4…

2026.07.28 · 周二6 分钟阅读

Lucebox 团队在 AMD Ryzen AI MAX+ 395(代号 Strix Halo)平台上跑通了 DeepSeek V4 Flash 这款 284B 参数的 MoE 大模型,借助自研的 ROCmFPX 量化格式族与 DSpark 推测解码路径,在 128 GB 统一内存下将单用户解码速度推至 32.0 tok/s,稀疏预填充达到约 250 tok/s,相关推理栈以 Apache-2.0 协议开源。

硬件与模型配置

本次跑通的硬件为单台 AMD Ryzen AI MAX+ 395,集成 Radeon 8060S(gfx1151)核显与 128 GB LPDDR5X 统一内存,运行 ROCm 7.2.4。目标模型 DeepSeek-V4-Flash-ROCMFP2-STRIX.gguf 体积 102.3 GB;推测解码草稿模型 DeepSeek-V4-Flash-DSpark-draft-Q4RMFP4-denseF16.gguf 体积 11.3 GB。服务器默认上下文长度 8192 tokens,平台 profile 设为 performance,Radeon 高性能档位(实测 2.9 GHz)开启 q=4 校验上限。

ROCmFPX:把 284B 权重压进 128 GB

ROCmFPX 是一套基于 AMD ROCm/HIP 路径构建的块级量化格式族,每个块存放 32 个权重的低位编码以及一到两个缩放因子:

  • ROCmFP2:10 字节/块,约 2.50 bit/权重
  • ROCmFP3:约 3.50 bit/权重
  • ROCmFP4(快速路径):约 4.25 bit/权重

针对 DeepSeek V4 Flash,Lucebox 补齐了缺失的 2-bit 格式及其 HIP 内核,并按张量敏感度设计 Strix 专属的混合精度方案:路由专家的 gate 与 up 矩阵使用 ROCmFP2,专家 down 投影使用 ROCmFP3,稠密或敏感投影保留 ROCmFP4 或更高精度。量化过程配合 importance matrix,并保留模型的 MTP head。最终模型体积 102.3 GB,相当于平均约 2.88 bit/参数。文件名中的 ROCMFP2 仅表示主导格式,并非所有张量都是 2-bit。

解码:32 tok/s

在不启用推测解码时,DeepSeek 专属的 HIP 解码路径在 ROCmFPX 的权重供给下自回归解码速度为 25.31 tok/s。叠加 DSpark 推测解码后,草稿模型提议最多 3 个新 token,284B 目标模型在一个融合 pass 中验证 4 个位置(含当前种子位),一次提交所有接受的 token:

  • Propose:DSpark 草稿基于捕获的目标特征提议若干 token
  • Verify:q=4 目标 pass 通过融合 HIP 图批量校验多个位置
  • Commit:接受的公共前缀一次性提交,目标侧在首次 miss 处修复

在 q=4 上限、关闭自适应宽度的公开配置下,解码速度达到 32.0 tok/s,相比纯自回归提速 26.4%。增益大小取决于草稿 token 的接受率。

稀疏预填充:约 250 tok/s

启用 --ds4-prefill sparse 后,公开的 LocalMaxxing 跑分显示预填充 245 tok/s。在一项独立的 7960 token 验证中,索引式稀疏预填充达到 251.79 tok/s,8K 区间的成绩落在 246.8–255.9 tok/s 之间;约 24K token 时吞吐降至 221.9 tok/s。稀疏预填充利用 DeepSeek V4 的 learned indexer 限制压缩历史的注意力范围,并按层批处理计算。由于计算顺序改变,输出与逐 token 精确预填充并非字节一致,因此该模式保持 opt-in。在自测的小样本上,稀疏模式取得 GSM8K 10/10、HumanEval smoke 3/3,但作者尚未开展大规模质量评估。

跑分对比与开源复现

该成绩已提交至 LocalMaxxing。对比同平台历史条目,HipFire 在 Radeon 8060S 上跑出 18.99 tok/s,DwarfStar 在 128 GB 统一内存组别中保持 15.6 tok/s,Lucebox 的成绩分别领先 68.5% 与 2.05 倍。

Lucebox 将推理服务器、ROCmFPX 量化工具链与 Strix 适配一并开源,许可证 Apache-2.0。仓库 Luce-Org/lucebox 提供 HIP 构建脚本,目标设置 DFLASH27B_GPU_BACKEND=hipDFLASH27B_HIP_ARCHITECTURES=gfx1151。模型权重托管在 Hugging Face:

  • 目标模型:Lucebox/DeepSeek-V4-Flash-ROCMFPX
  • 草稿模型:Lucebox/DeepSeek-V4-Flash-DSpark-Drafter-GGUF

启动时设置环境变量 DFLASH_DS4_SPEC=1DFLASH_DS4_FUSED_VERIFY=1DFLASH_DS4_SPEC_Q=4DFLASH_DS4_TIMING=1 并把温度固定为 0 即可复现公开跑分;解码速度会输出在服务器的 [deepseek4] DSpark decode 行。

信源