桃子桃子快讯
返回首页
模型发布

OpenAI 发布 GPT-6 Sol 与 Luna:API 定价砍半,多项基准对标 Claude

OpenAI 推出 GPT-6 Sol 与 Luna,API 价格较 5.6 系列降低 50%,多项基准成绩对标 Cla…

2026.09.23 · 周三4 分钟阅读

OpenAI 深夜上线 GPT-6 Sol 与 GPT-6 Luna 两款新模型,同系列发售体系相应变化——Sol 承担此前中端档位(Terra)的位置,Astra 承担此前的 Sol 档位,Luna 维持原定位。与上一代 5.6 系列相比,新系列 API 价格直接砍 50%,其中 Luna 的输出价格降幅更大。Luna 的输入价格已低于 DeepSeek-V4.1 Flash 的梁文谷档位(每百万 token 0.15 美元)。OpenAI 表示,降价得益于缓存与推理环节的效率提升。

价格与档位定位

OpenAI 调整了档位划分:Astra 承担此前的 Sol 定位,Sol 承担此前的 Terra 定位,Luna 保持不变,原 Terra 生态位被挤掉。Sol 的不建议开启 Max 档,因为相对 high/xhigh 档位效果提升有限但价格涨幅显著,部分榜单上 Max 反而低于 xhigh。Luna 的输出价格降幅超过 50%。

多项基准对标 Claude

  • AutomationBench(覆盖销售、营销、运营、客服、财务、人力资源 6 大领域 47 个工具):GPT-6 Sol 的 high 和 xhigh 档位分别达到 Astra 的 light 和 medium 水平;Claude Opus 5 在 max effort 下得分与 Sol 的 medium 相当,但单任务成本是 Sol 的 11.1 倍。
  • Agents' Last Exam:GPT-6 Sol 在 max effort 下得分 56.4%,超过 Claude Opus 5 在该测试中的最高分,成本低 60%。
  • FrontierCode(评估代码是否达到可合并进真实代码库标准):GPT-6 Sol 相比 5.6 Sol 有明显提升,能以更低成本匹配 Claude Fable 5.1 xhigh。
  • DeepSWE v1.1(复杂软件工程任务测试):GPT-6 Sol 与 5.6 Sol 水平接近,但成本显著降低。
  • GPT-6 Luna 在 max effort 下,DeepSWE v1.1 得分 66.6%,与 Claude Opus 5 和 Fable 5 在 medium effort 下水平相当,成本分别低 93% 和 96%。

编程场景与成本压力

OpenAI 披露了一组内部数据:公司内部的 Coding Agent 使用量呈指数级增长,按 API 价格折算,中位数研究员每天的 token 消耗已超过 600 美元,90 分位研究员超过 7000 美元。编程是本次重点展示方向,Sol 与 Luna 旨在降低长周期、复杂任务下的持续使用成本。

事实准确性与对齐

OpenAI 用一组从真实 ChatGPT 对话中提取的、用户曾标记过事实错误的案例进行测试。GPT-6 Sol 的错误率约为上一代的一半,接近 Astra 水平;GPT-6 Luna 在较高 effort 下能匹配 GPT-5.6 Sol 的准确度,成本仅为后者的百分之一。Sol 与 Luna 在对齐方面也优于 5.6 同级模型,包括在编程任务中做出误导性声明的比率更低。

基础设施改进

  • 提示词缓存:改进后默认命中率提升,命中输入 token 享 90% 价格折扣;新增缓存监控面板与诊断工具,可查看使用情况、定位未命中原因。
  • 缓存连续性:调整推理 effort 级别或开关工具时,不再打断之前的缓存上下文。OpenAI 透露,过去几个月里这些优化让 GitHub Copilot 需要重新处理的提示 token 比例下降超过 50%,涉及数十亿次请求。
  • 对话风格:把 Astra 改进过的沟通方式带到 Sol 和 Luna 上,在技术、编程对话中更清晰、更少术语、回复整体更简短。

下一步

OpenAI 表示,Codex 相关额度将于周二重置,具体时间未定。开发者可在 Codex 设置中手动开启 Max 档(默认关闭)。

(来源:OpenAI 官方博客与量子位,经 36 氪授权发布)

信源