模型发布
蚂蚁百灵发布 Ling-3.0-Flash:124B 总参数仅激活 5.1B
蚂蚁百灵推出 124B 总参数、5.1B 激活的混合推理模型 Ling-3.0-Flash,聚焦 Agent 场景,即将…
2026.07.27 · 周一约 2 分钟阅读
蚂蚁集团百灵团队于 7 月 24 日正式发布新一代原生混合推理模型 Ling-3.0-Flash。该模型总参数量为 124B,但单次推理仅激活 5.1B 参数,官方称在基础推理、指令遵循及长文本处理等核心指标上可对标甚至超越参数规模 2 至 3 倍的行业领先模型。模型已上线 OpenRouter 并限时免费一周,随后将正式开源。
模型规模与定位
Ling-3.0-Flash 采用「小激活、大容量」的设计路线,总参 124B、激活 5.1B,激活比约为 1:24。百灵团队表示,这一设计在大幅压缩算力开销的同时,试图维持与更大规模模型相当的综合能力,强调「智效比」与落地性价比。
针对 Agent 场景的深度优化
该版本的重点打磨方向是 AI Agent 实际应用:
- 训练阶段扩展了超过 10000 个真实交互环境;
- 优化了复杂任务中的自我纠错与长程规划机制;
- 重点提升代码编写、任务拆解与多源信息深度调研等场景的自主闭环交付能力。
百灵同时为其匹配了配套的工程与协作架构:
- 引入集群级分级缓存,长输入下首字响应延迟降低 60% 至 80% 以上;
- 升级多智能体协同架构,支持不同 Agent 分工协作与相互校验,降低单模型误判风险。
底层架构:KDA + MLA 混合注意力
实现「小体量、高智能」的关键在于底层计算架构的重新设计:
- 预训练阶段即采用混合注意力架构,以 5:1 的比例交替堆叠 KDA 线性注意力层与 MLA 层;
- 将上一代 Lightning Attention 升级为 KDA(Kimi Delta Attention),在 Delta Rule 状态更新中引入细粒度对角门控,以更精准地记忆长文档与代码库中的关键信息;
- 进一步压缩专家激活比例,每个 Token 的专家激活由前代的 1/32 降至 1/64,提升「效率杠杆」。
开放与可用性
Ling-3.0-Flash 已上线 OpenRouter,限时免费体验一周,此后将正式开源权重。对于关注 Agent 落地与推理效率的开发者而言,这是一个值得跟踪的国产模型动态。
