桃子桃子快讯
返回首页
行业动态

AMD 联合 Lucebox:DeepSeek V4 Flash 推理 3.63 倍于 DGX Spark

Lucebox 与 AMD 合作,用 R9700 + Strix Halo 异构方案在 DeepSeek V4 Flas…

2026.07.31 · 周五2 分钟阅读

Lucebox 与 AMD 合作发布了一项消费级异构硬件推理基准:在 DeepSeek V4 Flash 上,由 AMD Radeon AI PRO R9700 搭配 Strix Halo 组成的「Lucebox」方案,跑出 51.1 tok/s 的全 284B 模型吞吐,约为单台 NVIDIA DGX Spark 的 3.63 倍,整套配置价格也较购买两台 DGX Spark 低 2899 美元。该成绩来自厂商在 Reddit r/LocalLLaMA 的自发布帖,原始数据尚未由第三方独立复现。

核心数据

  • 整模型规模:DeepSeek V4 Flash 全量 284B 参数
  • 推理速度:51.1 tok/s(端到端 decode 吞吐)
  • 对比基准:单台 NVIDIA DGX Spark,性能比为 3.63×
  • 价格差异:比购买两台 DGX Spark 节省 2899 美元
  • 当前配置:q2 量化、16k 上下文窗口

异构并行方案

Lucebox 在其官方技术博客中描述了所谓「asymmetric parallelism」的实现思路:

  • AMD Radeon AI PRO R9700 负责 dense 路径、热专家(hot experts)、KV cache 与 draft 模型
  • Strix Halo 利用其 128GB 统一内存承载其余专家,并行而非串行地参与计算
  • 目标是把不同负载分配到各自最适合的硬件单元上,避免传统方案中冷热专家互相等待的问题

局限与后续工作

厂商在帖子中坦承,目前仍属于实验性配置,仅在 q2 量化、16k 上下文的设定下测得上述结果。为了把可用上下文提升至 64k–128k,团队正在引入 KVFlash 等技术以缓解长上下文带来的显存与带宽压力。在缺乏第三方独立复现与更多模型覆盖之前,这一成绩更宜视为 AMD ROCm 生态与 Strix Halo 平台在大模型推理方向上的一次有意义的尝试,而非可下定论的行业基准。

信源