Ling-3.0-flash 权重未发布,三大推理引擎适配现状盘点
社区汇总 Ling-3.0-flash 开源进度与 SGLang、vLLM、llama.cpp 适配进展。
Ling-3.0-flash 由 AntLing AGI 团队推出,采用 KDA + MLA 混合注意力架构,并延续 Ling 系列使用的 Bailing MoE 变体(BailingMoeV2_5)。该模型免费试用窗口将开放至 8 月 3 日,但官方截至目前仅表示「开源发布即将到来」,模型权重尚未上线 Hugging Face。对于关注本地部署的开发者而言,三大主流推理引擎的支持状态更值得关注。
SGLang:承诺首发日支持
SGLang 团队 23 日公开表态,正在与 Ant Ling 团队合作,将为 Ling-3.0-flash 提供 day-0 支持,并将该模型描述为 KDA + MLA 混合注意力架构。但截至发文,SGLang 与 vLLM 仓库内均未见相关公开 PR。
vLLM:权重落地后才会跟进
vLLM 团队的官方声明称支持「即将上线,将在模型权重开源后提供」,并花较大篇幅为「先发布、后开源权重」这一节奏背书,希望其他厂商效仿。这意味着权重发布前不会有可用的代码合并。
llama.cpp:Bailing MoE 才是真正瓶颈
此前社区讨论多关注注意力机制,但 llama.cpp 早已合入 delta-net/KDA 内核(来自 Qwen3.5、Qwen3-Next、Kimi-Linear 等项目)。真正的障碍在于 Bailing MoE 变体的转换路径:
- Ling-2.6-flash(BailingMoeV2_5)特性请求 Issue #22641 于 5 月 3 日提出,仅获 7 个 upvote,无人实现,6 月 18 日被关闭为「not_planned」。
- 更早的 Ling v2 支持 PR #16028 开了近三个月后被关闭,未合并。
- llama.cpp 中唯一落地的 Bailing MoE 是 2025 年 3 月的原始版本,且由 llama.cpp 维护者本人完成,并非实验室贡献。
历史节奏与发布时间线
AntLing AGI 官方 7 月 24 日的发布帖中明确写道:「免费体验持续到 8 月 3 日,开源发布即将到来,敬请期待。」这一关键信息此前在社区讨论中并未被注意到。参照前代 Ling-2.6-flash 的节奏——4 月 22 日宣布、一周免费 API、4 月 28 日权重上线 HF——权重大概率在免费窗口结束后不久发布。
落地顺序预判
基于当前生态准备情况,若权重顺利发布,现实的落地顺序为:
- SGLang:最早,已有合作承诺
- vLLM:紧随其后,权重上线即可跟进
- llama.cpp / GGUF:取决于是否有志愿者提交 Bailing MoE V2_5 转换 PR
作为对比,昨日开源的 K3 模型在权重发布后数小时内即有部分 GGUF 量化版上线 HF,因为相关管道已就绪。Ling-3.0-flash 目前缺乏这一基础设施,GGUF 适配可能需要更长时间。Issue #22641 在关闭前始终无人回答「BailingMoeV2_5 距离可转换还有多远」这一问题。
