桃子桃子快讯
返回首页
工具

开发者推出 DGX Spark 专用推理运行时 Eider

基于 Rust 与 CUDA 自研的 Eider 推理运行时,面向 GB10 平台,主打 NVFP4 与快速启动。

2026.07.20 · 周一3 分钟阅读

近日,一位开发者在 Reddit r/LocalLLaMA 社区发布了自研推理与服务运行时 Eider,专门面向 NVIDIA DGX Spark(GB10,Grace Blackwell)及其衍生平台。项目仓库已托管在 GitHub,作者明确表示 Eider 并非基于 llama.cpp 或 vLLM 等既有推理框架,而是从零开始用 Rust 与 CUDA 编写,以充分利用 SM121 GPU 的 NVFP4 量化能力。

项目定位与设计取舍

作者将 Eider 定位为一个「更聚焦、更快启动」的本地推理运行时,目标场景是个人本地编程与小规模多会话调度,希望避免等待主流框架对 NVFP4 或 SM121 做适配的漫长过程。其核心差异化特性包括:

  • 原生支持 NVFP4 数据路径;
  • 可将专家(expert)按需从磁盘换入/换出,突破显存上限;
  • 内置 OpenAI 兼容的 Responses 与 Chat Completions 服务;
  • 针对 Qwen、StepFun、Gemma 等注意力路径提供紧凑的 NVFP4 KV cache。

在项目说明中,作者坦言大部分内核层代码由 AI 助手生成,自己「并不擅长数学」,并表示项目仍处于从个人研究向生产引擎过渡的爬坡阶段。

模型支持与运行能力

Eider 目前声明可运行以下模型(均为作者自述,未经官方确认):

  • Qwen3.6 dense 与 MoE 变体;
  • Agents-A1;
  • StepFun 的 Step-3.7-Flash;
  • Gemma 4 26B-A4B;
  • NVIDIA 的 Nemotron 3 Puzzle 混合架构(主干注意力 + Mamba 循环状态)。

作者特别提到,借助「专家按需换页」机制,Eider 可以在显存中容纳 Step-3.7-Flash,而 vLLM 目前做不到这一点;llama.cpp 虽然也能跑,但只能在更低质量的量化档位下工作。

现状与局限

项目仍处于早期阶段,作者承认「大部分时候它能工作」,并邀请社区试用并反馈 bug。同时需要注意的是:

  • 这是个人兴趣驱动的研究型项目,非官方商业产品;
  • 仓库中并未公布 benchmark 数字或系统性性能对比;
  • 大量底层代码由 AI 助手生成,可读性与正确性需要使用者自行评估。

对拥有 DGX Spark 且希望在本地获得 NVFP4 推理能力的开发者而言,Eider 提供了一个值得尝试的实验性选择;对一般用户来说,更成熟的 llama.cpp 与 vLLM 仍是更稳妥的默认方案。

信源