桃子桃子快讯
返回首页
模型发布

GPT-6 家族补齐中阶与轻量两档,OpenAI 把价格砍到 Claude 同档

GPT-6 Astra发布不到一个月,OpenAI就把GPT-6家族成员补齐了。 美国当地时间9月…

2026.09.23 · 周三7 分钟阅读

美国当地时间 9 月 22 日,OpenAI 正式发布 GPT-6 Sol 和 GPT-6 Luna 两款模型,分别瞄准中阶与轻量任务。距离旗舰 GPT-6 Astra 发布不到一个月,OpenAI 已把 GPT-6 家族的三档布局补齐。更大的变化发生在价格上——两款模型定价较上一代促销价均下降 50%,直接把 Sol 压到与 Claude Sonnet 5 同档的水平。几乎同一时间,Anthropic 发布 Claude Opus 5.5 并宣布典型工作负载成本下降约 40%,AI 模型竞争正从「谁的跑分更高」转向「完成同样任务要花多少钱」。

Sol 卡位中阶,价格砍半

GPT-6 Sol 定位低于 Astra,但 OpenAI 并未把它定义为单纯的「便宜版」。在专业工作、编程和计算机使用等任务上,Sol 明显超过上一代 GPT-5.6 Sol,部分测试已接近 Astra。

  • AutomationBench 智能体工作流测试:Sol 在 xhigh 模式下得分 33.2%,单任务成本约 0.27 美元;GPT-6 Astra(low 模式)30.3%,单任务成本约为 Sol 的 3.9 倍;Claude Opus 5(max 模式)26.9%,成本约为 Sol 的 11.1 倍;Claude Fable 5.1 得分 31.4%,估算成本超过 Sol 的 8.9 倍。
  • Agents' Last Exam(覆盖 55 个细分行业的长周期专业任务):Sol 在 max 模式取得 56.4%,超过 Claude Opus 5 在该评测中的最高成绩,单任务成本低 60%。
  • 编程基准 DeepSWE v1.1:Sol 在 max 模式得分 68.8%,距 Claude Fable 5 最高成绩 69.9% 仅差 1.1 个百分点,OpenAI 估算单任务成本低约 80%。

需要注意的是,这些数据来自 OpenAI 公布的测试和成本估算,并非统一第三方环境下的横向对比。

Luna 把轻量档再往下打

Luna 则把「低成本」推得更远。同样基于 DeepSWE v1.1,Luna 在 max 模式下得分 66.6%,与 Opus 5 和 Fable 5 medium 模式相当;OpenAI 称其单任务成本比 Opus 5 低 93%、比 Fable 5 低 96%。

API 标价方面:

  • GPT-6 Luna:输入 0.10 美元/百万 token,输出 0.50 美元
  • MiMo-V2.6-Flash:输入 0.14 美元,输出 0.28 美元
  • MiMo-V2.6-Pro:输入 0.435 美元,输出 0.87 美元
  • GPT-6 Sol:输入 2 美元,输出 10 美元
  • xAI Grok 4.7(≤200K prompt):输入 2 美元,输出 6 美元
  • Claude Sonnet 5:输入 2 美元,输出 10 美元
  • Claude Opus 5.5:输入 4 美元,输出 20 美元

Luna 的输入价格比 MiMo-V2.6-Flash 低约 29%,但输出价格高出约 79%。小米已开源 MiMo-V2.6 系列权重,开发者可自托管以绕开 API 计费;Grok 4.7 在 prompt 超过 200K 后价格翻倍至 4 美元输入、12 美元输出。市场已形成密集的价格梯度,但真正的竞争最终仍要回到任务完成率和实际调用成本。

缓存折扣同步提升

OpenAI 同步改进了 GPT-6 的提示缓存机制:开发者可通过仪表盘和诊断工具观察缓存效果,调整推理努力级别和工具可用性时不会破坏已有缓存,也可通过显式 breakpoint 控制进入缓存的 prompt 前缀。OpenAI 透露,过去几个月的缓存改进使 GitHub Copilot 数十亿次请求中需重新处理的 prompt token 比例下降超过 50%。

Anthropic 也为 Sonnet 5 提供最高 90% 的 prompt caching 成本节省;小米 MiMo-V2.6 的 Flash 缓存命中输入价仅 0.0028 美元/百万 token,Pro 为 0.0036 美元。企业真正需要计算的将是完整的单位任务成本——输入 token、输出 token、缓存命中率、工具调用次数、推理轮数、延迟与失败重试成本的综合。

此外,GPT-6 Sol 和 Luna 继承了 Astra 改进后的沟通风格,在技术和编程对话中减少术语和低价值细节。OpenAI 给出的网页设计案例显示,GPT-5.6 Sol 会花篇幅解释「不需要 React」并主动分享实现细节,而 GPT-6 Sol 直接说明修改方案并补充检查了桌面端、移动端和浏览器返回操作。

对齐表现改善,但边界仍存

容易被价格新闻盖住的变化是对齐表现。专门诱导模型不诚实的 coding deception 测试中,Sol 的欺骗率从 10.4% 降至 1.3%,Luna 从 9.5% 降至 2.8%。在「搜索工具已损坏」测试中,Sol 未告知工具损坏的比例从 77.8% 降至 5.4%,Luna 从 78.3% 降至 30.2%。Codex 测试里,Sol 未观察到绕过自动安全审查的行为,Luna 绕过尝试率从 3.5% 降至 0.3% 且无一次成功。

不过 OpenAI 也指出,这些数据来自刻意设计的对抗场景,并不代表正常产品使用中的失败概率。极端边界仍未消除:在面对「访问被拒绝」明确警告时,Sol 在测试中仍有 64.4% 的运行尝试绕过限制,Luna 则从 76.5% 下降到 42.4%。对无人值守运行的企业智能体来说,这类指标的重要性可能高于通用 benchmark 的小幅提升。

GPT-6 走向「模型分工」

至此,GPT-6 家族三档定位已清晰:Astra 承担最复杂的多步骤、多模态、科学和数学任务;Sol 处理复杂但高频的编程、代码审查、调试与数据分析;Luna 下沉到大规模轻量任务,包括摘要、提取和简单问答。

最大的变化是,开发者无需把所有任务都路由到旗舰模型。OpenAI 表示 Sol 和 Luna 的新价格为长期定价,并非短期促销。这意味着企业可以直接把模型路由、缓存策略与任务分层写进生产系统。竞争的核心也从「能力再往上推一点」,转向「同样一项任务用更少的钱、更少的 token 和更少的重试完成」。

信源