蚂蚁百灵开源 Ling-3.0-tiny:1.3B 激活参数跑出 25 分智能指数
蚂蚁百灵开源 7.9B 总参、1.3B 激活的 MoE 模型 Ling-3.0-tiny,采用 KDA 与 MLA 3:…
蚂蚁集团百灵大模型团队开源了一款面向本地与边缘部署的轻量级混合推理 MoE 模型 Ling-3.0-tiny,总参数量 7.9B,每个 Token 激活 1.3B 参数。该模型同步发布 BF16、FP8、INT4 三个精度版本,并已在 NVIDIA DGX Spark、MacBook 与 Mac mini 等设备上完成验证,主打「高性能 + 低门槛部署」的组合。
以小博大的综合能力
在 Artificial Analysis Intelligence Index 评测体系中,Ling-3.0-tiny 综合得分 25,仅比 Gemma-4-26B-A4B 低 1 分,同时高于 gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B 与 Gemma-4-E4B。该指数覆盖真实任务、工具使用、代码、科学推理、知识可靠性与长上下文等九个方向,综合反映模型的跨任务能力。
更值得关注的是其 Agent 表现:在 Artificial Analysis Agentic Index 上取得 16 分,超过 Gemma-4-31B;其中 GDPval-AA v2 为 772 Elo,τ³-Banking 为 20.80。在 IMO-AnswerBench、非幻觉率等指标上也取得领先。这意味着,尽管激活参数规模仅 1.3B,它已经具备承接代码辅助、知识工作流、工具调用与本地 Agent 应用的能力基础。
KDA + MLA 的混合线性架构
Ling-3.0-tiny 延续 Ling-3.0 系列的原生混合线性注意力技术路线,并做了轻量化优化:
- 注意力机制:采用月之暗面 KDA(Kimi 增量注意力)与 DeepSeek MLA(多头潜在注意力)3:1 交替堆叠,共 4 层一组,提升长上下文处理效率。
- MoE 前馈:设置 128 个稀疏路由专家,每 Token 激活 8 个路由专家与 1 个共享专家,兼顾参数效率与计算成本。
- 推理机制:原生混合推理,可通过
enable_thinking参数在单次请求中灵活切换快速响应与多步思考模式。
这种「站在 Kimi 与 DeepSeek 肩膀上」的组合,让模型在长上下文建模、参数效率与本地推理成本之间找到平衡点。
覆盖从 DGX Spark 到 Mac mini 的部署方案
百灵同步开源 BF16、FP8、INT4 三个版本,让开发者按硬件条件与精度需求灵活选择。关键部署数据如下:
- DGX Spark(FP8):2K 输入下单请求稳态解码约 100–105 tokens/s,两路并发聚合吞吐约 161 tokens/s,权重约 7.85GB。
- MacBook(FP8,M4 Pro):解码约 86–90 tokens/s,8K 上下文峰值内存占用 8.34GiB;首 Token 响应低于 100 ms。
- 输出速度:综合输出 160+ tokens/s,生成 500 个 Token 端到端约 18 秒(含思考过程)。
为验证高频本地交互能力,团队在 36GB 内存 MacBook Pro 上复刻了 Infinite Wiki 的核心体验,全程本地推理、首 Token 延迟低于 100 ms,所有数据留存设备端,无需云端 API 计费。
下一步:补强事实准确性与长程 Agent 稳定性
百灵表示,后续将重点增强 Ling-3.0-tiny 的长尾知识覆盖与事实准确性,提升复杂工具调用与长程 Agent 任务稳定性,并持续优化代码、科学推理与长上下文能力。团队还将完善 FP8/INT4 版本的硬件适配与推理框架支持,与硬件厂商、高校及开发者社区共建轻量模型生态。
开源地址(Hugging Face):
- inclusionAI/Ling-3.0-tiny
- inclusionAI/Ling-3.0-tiny-fp8
- inclusionAI/Ling-3.0-tiny-int4
ModelScope 同名仓库同步上线。
