开源
Ling-3.0 正式支持 llama.cpp,Intel Arc B580 推理基准出炉
Ling-3.0 系列通过 PR #26608 合入 llama.cpp 主线,作者在 Intel Arc B580 上…
2026.08.19 · 周三约 3 分钟阅读
Ling-3.0(内部代号 BailingMoE3)已正式合入 llama.cpp 主线仓库。从 build b10472 开始,开发者即可在本地运行该系列模型。社区量化作者 bartowski 已放出两份 GGUF imatrix 量化版本,分别为 Ling-3.0-tiny(8B)与 Ling-3.0-flash(127B),便于用户在消费级硬件上直接加载。
关键变更
- PR #26608 已合并至 master 分支,BailingMoE3 支持成为官方能力,仍有少量细节待完善。
- 用户需使用 b10472 或更高版本构建,方可获得 Ling-3.0 支持。
Intel Arc B580 上的实测结果
作者在 Linux 系统下使用 Vulkan 后端驱动 Intel Arc B580(12GB 显存)对 Ling-3.0-tiny 的 Q8_0 量化版本进行了 llama-bench 测试,主要配置为 -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0。
- 短上下文(pp16384):约 120.76 t/s,文本生成 tg128 约 114.24 t/s,tg32 约 114.78 t/s。
- 长上下文(pp32768):提示处理约 62.53 t/s,tg32 约 110.49 t/s。
- 128K 上下文:在 12GB 显存内可使用
-c 131072 -ngl 99 -fa 1 --cache-type-k q8_0 --cache-type-v q8_0运行完整 128K 上下文,作者表示速度「出乎意料地快」,但仍有少量 warning 需要进一步验证更长上下文的稳定性。
实际意义
Ling-3.0-tiny 属于典型的 MoE 架构(总参数 7.89B,激活参数约 1.3B),Q8_0 量化后体积约 7.83 GiB,可在 B580 这类中端独显上以接近 120 t/s 的速度完成提示处理。配合 q8_0 KV cache,12GB 显存在作者实测中可承载 128K 上下文窗口,对希望在本地进行长文档推理或实验的开发者具有参考意义。
需要指出的是,原文仅为单一用户、单一硬件的配置反馈,结果未必能直接迁移到 NVIDIA、AMD 或 Apple Silicon 平台,更大规模的 Ling-3.0-flash(127B)在消费级硬件上的可行性仍待后续验证。
