工具
社区方案让 DeepSeek-V4-Flash 在双 R9700 上跑到 40-50 tok/s
开发者发布面向双卡 R9700 的 DeepSeek-V4-Flash-0731 推理方案,给出预编译量化包与稳定性修复…
2026.09.24 · 周四约 3 分钟阅读
一名 ID 为 neuromaniacmd 的开发者在 Reddit r/LocalLLaMA 板块分享了在双卡 AMD Radeon AI PRO R9700(每张 32 GB)上运行 DeepSeek-V4-Flash-0731 的完整方案,包含一个面向 RDNA4 架构定制的推理引擎、预编译量化包以及若干稳定性修复,并公布了一组端到端性能数据。
推理引擎与硬件配置
该方案基于一款名为 affinity 的推理引擎,原作者 Yoshi Exeler(StillDeadcode),专门为一张或两张 RDNA4 显卡运行 DeepSeek-V4-Flash 设计。引擎的核心思路是「把热专家保留在 GPU,其余从主机内存流式调入」,并集成 DeepSeek 原生的投机式 draft 模型以提升解码效率。
测试平台配置:
- 显卡:2 × Radeon AI PRO R9700(每张 32 GB)
- 主机内存:192 GB
- 上下文长度:262K,在加载时全部分配
量化与稳定性修复
开发者额外做了两件事:
- 预编译 0731 量化权重。发布在 Hugging Face 的
neuromaniacmd/DeepSeek-V4-Flash-0731-affinity-2.875bpw,使用 affinity 自带量化器生成,路由专家 2.875 bpw、teamblobfish 的 imatrix、密集权重为 FP8,并附带 0731 的内建 draft 模型。该量化只在 affinity 中可用,不兼容 llama.cpp 与 vLLM;可省去原版约 149 GB 的下载和约 2.5 小时的本地量化流程。 - fork 修复若干稳定性问题。在双 32 GB 卡场景下,处理首个长 prompt 后服务端会持续输出「流畅但无意义」的文本,且无法恢复,根因是大页(hugepage)在映射到显存余量不足的 GPU 时发生塌缩。修复已同时提交上游 PR,并提供基于 TheRock ROCm 7.14 的 Docker 镜像,主机无需安装 ROCm。
实测性能
- Prefill:4K–64K 上下文下约 1,260–1,360 tok/s。
- 解码:长结构化回答约 40–50 tok/s,自由文本与推理场景约 31–35 tok/s,最终速度取决于 draft 模型猜测被采纳的频率。
- 长上下文检索:4K / 16K / 64K 的「大海捞针」测试均 3/3 通过。
- 多轮 Agent 任务:一项通过 shell 工具将 Excel 转为 DuckDB 的 15 轮任务全程通过检查,无工具调用格式错误。
使用限制
方案有明确边界,部署前需注意:
- 仅支持 RDNA4(gfx1201),最多两张卡。
- 需按模型卡推荐的 temperature 1.0 采样;在 temperature 0.6 下该量化会陷入推理循环。
- 需要 64 GB 以上主机内存以承载放不进显存的专家层。
- 另有一个实验性的 DeepSeek-V4.1-Flash 分支,结果正确但双卡下仅约 14 tok/s。
开发者表示,关于引擎本身的问题更适合在上游项目处提问。
