开源
llama.cpp 新增对 Laguna XS.2 与 M.1 两款 MoE 编程模型的支持
llama.cpp 提交 PR,为 poolside 的 Laguna XS.2(33B 总参 / 3B 激活)与 La…
2026.07.22 · 周三约 2 分钟阅读
llama.cpp 项目近日收到一项 Pull Request,新增对 poolside 公司两款面向「智能体编程」(agentic coding)与长程任务场景的 MoE 模型的本地推理支持,分别是 Laguna XS.2 与 Laguna M.1。两份模型权重均已托管在 Hugging Face,开发者可在本地环境中借助 llama.cpp 直接加载运行。
模型规格
- Laguna XS.2:总参数量 330 亿,每次推理激活参数量约 30 亿,采用 Mixture-of-Experts 架构,针对本地机器上的智能体编程与长程工作负载设计。
- Laguna M.1:总参数量 2250 亿,激活参数量约 230 亿,同样为 MoE 架构,定位相同。
两款模型均聚焦代码生成与长链条任务,适合作为本地代码助手或编程 Agent 的底座。
架构亮点:滑动窗口注意力 + 每头门控
Laguna XS.2 在 40 层 Transformer 中有 30 层采用 Sliding Window Attention(滑动窗口注意力),并配合 per-head gating(每头门控) 机制。
- 滑动窗口注意力可将注意力计算限制在固定大小的局部窗口内,显著降低 KV cache 占用与显存压力;
- 每头门控则允许模型在不同注意力头之间动态选择行为,提升对长短上下文的适应性;
- 在保持长上下文能力的同时,为本地推理带来更低的显存门槛和更快的生成速度。
生态意义
llama.cpp 是本地大模型推理的核心开源框架之一,对新模型结构的快速适配直接决定了开发者能否在消费级硬件上跑通新模型。此次 PR 提交,意味着 poolside 的两款 MoE 模型将有望在 llama.cpp 体系下获得 GGUF 等格式的支持,方便社区进行量化、部署与基准测试。考虑到 M.1 总参数高达 225B,未来更可能以量化形式在多卡或高显存工作站上运行;而 XS.2 的 30 亿激活参数则更适合单卡或高显存笔电本地体验。
对关注开源编程模型与本地推理生态的开发者而言,这是一项值得跟踪的后续进展。
