桃子桃子快讯
返回首页
工具

社区方案让 DeepSeek-V4-Flash 在双 R9700 上跑到 40-50 tok/s

开发者发布面向双卡 R9700 的 DeepSeek-V4-Flash-0731 推理方案,给出预编译量化包与稳定性修复…

2026.09.24 · 周四3 分钟阅读

一名 ID 为 neuromaniacmd 的开发者在 Reddit r/LocalLLaMA 板块分享了在双卡 AMD Radeon AI PRO R9700(每张 32 GB)上运行 DeepSeek-V4-Flash-0731 的完整方案,包含一个面向 RDNA4 架构定制的推理引擎、预编译量化包以及若干稳定性修复,并公布了一组端到端性能数据。

推理引擎与硬件配置

该方案基于一款名为 affinity 的推理引擎,原作者 Yoshi Exeler(StillDeadcode),专门为一张或两张 RDNA4 显卡运行 DeepSeek-V4-Flash 设计。引擎的核心思路是「把热专家保留在 GPU,其余从主机内存流式调入」,并集成 DeepSeek 原生的投机式 draft 模型以提升解码效率。

测试平台配置:

  • 显卡:2 × Radeon AI PRO R9700(每张 32 GB)
  • 主机内存:192 GB
  • 上下文长度:262K,在加载时全部分配

量化与稳定性修复

开发者额外做了两件事:

  • 预编译 0731 量化权重。发布在 Hugging Face 的 neuromaniacmd/DeepSeek-V4-Flash-0731-affinity-2.875bpw,使用 affinity 自带量化器生成,路由专家 2.875 bpw、teamblobfish 的 imatrix、密集权重为 FP8,并附带 0731 的内建 draft 模型。该量化只在 affinity 中可用,不兼容 llama.cpp 与 vLLM;可省去原版约 149 GB 的下载和约 2.5 小时的本地量化流程。
  • fork 修复若干稳定性问题。在双 32 GB 卡场景下,处理首个长 prompt 后服务端会持续输出「流畅但无意义」的文本,且无法恢复,根因是大页(hugepage)在映射到显存余量不足的 GPU 时发生塌缩。修复已同时提交上游 PR,并提供基于 TheRock ROCm 7.14 的 Docker 镜像,主机无需安装 ROCm。

实测性能

  • Prefill:4K–64K 上下文下约 1,260–1,360 tok/s。
  • 解码:长结构化回答约 40–50 tok/s,自由文本与推理场景约 31–35 tok/s,最终速度取决于 draft 模型猜测被采纳的频率。
  • 长上下文检索:4K / 16K / 64K 的「大海捞针」测试均 3/3 通过。
  • 多轮 Agent 任务:一项通过 shell 工具将 Excel 转为 DuckDB 的 15 轮任务全程通过检查,无工具调用格式错误。

使用限制

方案有明确边界,部署前需注意:

  • 仅支持 RDNA4(gfx1201),最多两张卡。
  • 需按模型卡推荐的 temperature 1.0 采样;在 temperature 0.6 下该量化会陷入推理循环。
  • 需要 64 GB 以上主机内存以承载放不进显存的专家层。
  • 另有一个实验性的 DeepSeek-V4.1-Flash 分支,结果正确但双卡下仅约 14 tok/s。

开发者表示,关于引擎本身的问题更适合在上游项目处提问。

信源