桃子桃子快讯
返回首页
研究论文

DeepSeek V4 Flash 在 AMD Strix Halo 上跑出 32 tok/s

Lucebox 在 128 GB 统一内存的 Ryzen AI MAX+ 395 上本地运行 284B MoE 模型 D…

2026.07.28 · 周二5 分钟阅读

Lucebox 团队在搭载 Radeon 8060S 与 128 GB LPDDR5X 统一内存的 AMD Ryzen AI MAX+ 395 上,完整本地运行了 DeepSeek V4 Flash 的 284B MoE 目标模型,单 batch decode 实测达到 32.0 tok/s。这是该模型首次在单一 APU 平台上完成端到端本地推理,且未使用任何独立 GPU、远程推理或第二台机器。提交至社区榜单 LocalMaxxing 后,该成绩较此前 Radeon 8060S 上的 18.99 tok/s(HipFire)领先约 68.5%,约为 Ryzen AI Max 395 统一内存组别历史最佳 15.6 tok/s(DwarfStar)的 2.05 倍。

硬件与模型配置

整个推理流程依赖 CPU 与 GPU 共享的同一片 128 GB 物理内存池,模型权重与运行时的中间数据无需在异构设备间复制。目标模型为 DeepSeek V4 Flash,284B 参数的混合专家结构;草稿模型 DSpark 仅 11.3 GB,连同目标权重共占约 113.6 GB,剩余约 14.4 GB 留给操作系统与运行时。

实测环境关键参数如下:

  • 硬件:Ryzen AI MAX+ 395、Radeon 8060S(gfx1151)、128 GB LPDDR5X
  • 目标权重:DeepSeek-V4-Flash-ROCMFP2-STRIX.gguf,102.3 GB
  • 草稿权重:DeepSeek-V4-Flash-DSpark-draft-Q4RMFP4-denseF16.gguf,11.3 GB
  • 软件栈:ROCm 7.2.4、HIP gfx1151、platform performance profile,q=4 验证上限
  • 服务端上下文长度:8,192 tokens

ROCmFPX:把 284B 装进 128 GB

为了让 284B 模型放进统一内存,团队没有沿用单一量化格式,而是开发了 ROCmFPX 家族——以 AMD ROCm/HIP 为底座的一组块式低比特编码。

  • ROCmFP2:每 32 个权重打包为 10 字节,约 2.50 bit/weight
  • ROCmFP3:约 3.50 bit/weight
  • ROCmFP4:约 4.25 bit/weight

针对 DeepSeek V4 Flash,团队补齐了缺失的 2-bit 格式与对应 HIP kernel,并按张量敏感度混合使用:体量最大的 routed-expert gate 与 up 矩阵使用 ROCmFP2,expert down 投影使用 ROCmFP3,密集或更敏感的投影保留 ROCmFP4 或更高精度。量化过程使用重要性矩阵,并保留了模型的 MTP 头。最终权重落在 102.3 GB,约 2.88 bit/parameter。

解码阶段,单 token 生成会流式拉取全部 43 层活跃权重,因此瓶颈主要是显存带宽。ROCmFPX kernel 直接读取 packed block,在寄存器内通过 AMD byte-permute 指令展开小码本,再喂入整数点积,省去一次额外的 codebook gather。

Decode 路径与 DSpark 投机解码

在不启用草稿模型的情况下,单纯自回归 decode 跑出 25.31 tok/s。进一步叠加 DSpark 投机解码后,在 q=4 验证上限、自适应宽度关闭的设定下达到 32.0 tok/s,相对自回归路径提升 26.4%。

DSpark 的三步流程:

  • propose:紧凑的三层草稿模型基于已捕获的目标特征提议若干 token
  • verify:q=4 路径下,284B 目标通过融合 HIP 图一次性检查多个位置
  • commit:正确前缀一次性提交,首个 miss 由目标修复

main 分支上还做了一项小优化:q=4 ROCmFP4 路径将每个 packed 密集权重只解码一次,并应用于全部 4 个验证列,相对原先的逐列展开再额外获得 2.1%–2.3% 提升。

Prefill 与质量校验

除了 decode,作者还提交了 sparse prefill 结果:8,192 tokens 验证集上达到 246.8–255.9 tok/s,约 245 tok/s;常规短 prompt 的精确 prefill 为 22.5–23 tok/s。LocalMaxxing 上提交的请求为 2,048 prompt + 510 output,采样温度 0,batch 大小 1。

需要注意的是,LocalMaxxing 上的对比条目引擎、量化方式、上下文长度与输出长度并不一致,因此并非受控 A/B 测试,仅作参考。文中也明确:和 Geometric 团队合作的 TOP_K/ARGSORT kernel 优化是在另一项微基准中测得的,main 分支公开的 32 tok/s 并不包含这部分贡献。

信源