开源
Ling 3.0 两款推理模型合并支持进 llama.cpp
inclusionAI 的 Ling 3.0 tiny 与 flash 两款推理模型已合并进 llama.cpp,支持本…
2026.08.17 · 周一约 2 分钟阅读
inclusionAI 新一代模型 Ling 3.0 已获得 llama.cpp 官方合并支持。本次合并包含两款 MoE 架构的推理模型,分别为 Ling-3.0-tiny 与 Ling-3.0-flash,二者均已在 Hugging Face 开放权重下载。
模型规格
- Ling-3.0-tiny:总参数 8B,激活参数 1B(8b1b)的 MoE 结构,定位轻量级本地推理。
- Ling-3.0-flash:总参数 124B,激活参数 5B(124b5b)的 MoE 结构,面向更高吞吐与复杂任务。
- 两款模型均明确标注为推理(reasoning)模型,与此前同名系列的定位有所不同。
生态意义
llama.cpp 是目前本地部署大模型最主流的推理框架之一,新模型一旦合并进入主分支,用户即可在无需额外编译分支的情况下,直接使用 CPU、GPU 或 Apple Silicon 等多种硬件后端运行 Ling 3.0 系列。本次合并对应的 PR 为 ggml-org/llama.cpp#26608,权重仓库分别为 inclusionAI/Ling-3.0-tiny 与 inclusionAI/Ling-3.0-flash。
当前局限
目前公开信息较为有限,仅披露了模型架构参数与权重地址,尚无官方发布的 benchmark 成绩、上下文长度、训练数据规模或与同类模型的横向对比。若需进一步评估 Ling 3.0 的实际能力,建议等待 inclusionAI 发布更详细的技术报告或在主流榜单上的实测数据。
