桃子桃子快讯
返回首页
开源

Solar Open 2 开源:250B 参数 MoE,主打长上下文与智能体

Upstage 在 Hugging Face 开源 Solar Open 2,250B 总参数仅激活 15B,混合线性与…

2026.07.22 · 周三2 分钟阅读

韩国 AI 公司 Upstage 在 Hugging Face 发布了 Solar Open 2,一款 250B 总参数、每次仅激活 15B 的混合注意力 MoE 开源大模型,主打智能体(agentic)工作流与长上下文场景。该模型权重以「open-weight」形式开放,定位对标目前最强的开源权重模型。

模型架构:Hybrid-Attention MoE

Solar Open 2 的核心特征是其 Hybrid-Attention Mixture-of-Experts 架构。在注意力层设计上,每 4 层中有 3 层采用线性注意力,1 层保留 softmax 注意力,整体形成交替堆叠的结构。

  • 总参数 250B,单 token 激活 15B;
  • 注意力层中 48 层仅有 12 层保留 KV cache,其余使用线性注意力并通过循环状态(recurrent state)内禀编码 token 顺序,因此去除了显式位置编码(NoPE),绕开了 RoPE 外推上限;
  • 长上下文场景下的显存占用约为同等结构全 softmax 模型的四分之一。

100 万 token 上下文与智能体定位

Solar Open 2 官方宣称支持 1M token 上下文,主要依赖线性注意力层在循环状态中保留位置信息,从而在扩展窗口时避免传统 RoPE 的外推瓶颈。

在产品定位上,模型针对三类 agentic 用例做了优化:

  • 办公生产力(office productivity);
  • 文档密集型工作(document-intensive work);
  • 编程(coding)。

模型强调工具调用、多步推理与端到端任务执行能力,官方表示在 agent 类基准测试上对标当前最强的开源权重模型。

训练与多语言

Solar Open 2 由前代 Solar Open 1(102B)通过选择性权重迁移初始化而来,仅保留 2.3% 与新架构兼容的权重,其余随机初始化。Upstage 称这一做法提高了 250B 规模下的训练起点,加速了早期收敛,从而以更低成本完成训练。

当前公开版本支持三种语言:英语、韩语、日语。模型权重已在 Hugging Face 的 upstage 组织页下发布,社区可下载并自行部署推理。

信源