桃子桃子快讯
返回首页
模型发布

OpenAI 发布 GPT-6 Sol 与 Luna:API 价格腰斩,性能继续卷

OpenAI 推出 GPT-6 Sol 和 Luna 两款新模型,API 价格较上一代下降 50%,主打更低成本的真实任…

2026.09.23 · 周三5 分钟阅读

OpenAI 正式发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,距 GPT-6 Astra 发布不足一个月。这是 OpenAI 首次在同一代模型下同时推出「高智能档」与「极致成本档」两款产品,并将 API 价格相对上一代直接腰斩,标志其竞争重心正从「模型有多强」转向「完成任务要花多少钱」。

价格与定位

两款模型采用与 GPT-6 Astra 相似的训练方法,并通过缓存与推理效率优化降低运行成本。API 价格相比上一代促销价下降 50%:

  • GPT-6 Sol:每百万输入 Token 从 4 美元降至 2 美元,输出从 20 美元降至 10 美元。
  • GPT-6 Luna:每百万输入 Token 从 0.20 美元降至 0.10 美元,输出从 1.20 美元降至 0.50 美元。

两款模型目前支持文本与图片输入,可通过 Responses API 与 Chat Completions API 调用,标准价格适用于最高 272K 输入 Token 的请求。

能力与基准表现

OpenAI 在多个测试集上公布了对比数据,强调 Sol 与 Luna 在保持智能水平的同时具备明显的成本优势。

专业工作场景:

  • 在 AutomationBench(评估 AI Agent 跨应用完成业务工作流的能力)的 xhigh 推理档下,GPT-6 Sol 得分超过同档 Claude Opus 5,但单项任务成本仅为后者的约 9%。
  • 在 Agents' Last Exam 的最高推理档下,GPT-6 Sol 取得 56.4%,单项任务成本较 Claude Opus 5 低约 60%。
  • 在 high 推理档下,GPT-6 Luna 较上一代提升 5.4%,单项任务成本降低 58%。

事实准确性:

  • 在一项基于匿名化真实用户对话的内部测试中,GPT-6 Sol 出现事实错误的次数约为上一代的一半,同时以更低成本接近 GPT-6 Astra 的可靠性水平。
  • 在更高推理档下,GPT-6 Luna 的表现可达 GPT-5.6 Sol 的水平,但单项任务成本约只有后者的百分之一。

编程能力:

  • 在 FrontierCode 1.1 Main 测试中,GPT-6 Sol 较 GPT-5.6 Sol 有明显提升,以更低成本追平 Claude Fable 5.1 在 xhigh 推理档下的表现。
  • 在 DeepSWE v1.1 测试中,GPT-6 Sol 在最高推理档下取得 68.8%,与 Claude Fable 5 的最高成绩 69.9% 相差 1.1 个百分点,单项任务成本低约 80%。
  • GPT-6 Luna 在最高推理档下取得 66.6%,单项任务成本比 Opus 5 低 93%,比 Fable 5 低 96%。

OpenAI 还透露,按 API 价格计算,目前一名普通研究人员每天使用 Token 的价值已超过 600 美元,使用量排名前 10% 的研究人员每天对应价值超过 7000 美元,成本压力成为编程 Agent 持续运行的关键瓶颈。

电脑操作:

  • 在 OSWorld 2.0 离线测试中,GPT-6 Sol 在 xhigh 推理档下达到 60.5%,与 Claude Opus 5 中等推理档的 60.3% 接近,但单项任务成本低约 80%。
  • GPT-6 Luna 在最高推理档下超过 GPT-5.6 Sol 的中等推理档水平,成本仅为后者十分之一。

GPT-6 Astra 仍是目前电脑操作能力最强的模型,Sol 与 Luna 的提升主要体现在成本效率上。

风格与输出变化

Sol 与 Luna 也继承了 GPT-6 Astra 的新沟通方式:表达更清晰,减少术语堆砌与奇怪措辞,整体回答略有缩短但不刻意牺牲信息量。OpenAI 认为,在代码修改、浏览器操作和长流程 Agent 任务中,模型是否易于控制、是否会输出无关内容,同样会影响实际任务成本。

行业背景与竞争格局

此次发布与 Claude Opus 5.5 几乎同日推出。Anthropic 公布的数据显示,Opus 5.5 在 Terminal-Bench 4.0、FrontierCode 与 CursorBench 等测试上继续保持强势,并强调典型任务运行成本较上一代下降约 40%。两家厂商正走向同一个方向:能力继续提升,但「完成真实任务要花多少钱」正在成为新的竞争焦点。

OpenAI 也提到,Sol 与 Luna 在 HealthBench 部分指标上未全面超过 GPT-5.6,原因是新模型回答明显变短,而部分测试需要覆盖大量细节。这说明传统 Benchmark 越来越难直接对应真实使用体验:70 分但耗 10 倍 Token 的模型,与 68 分但只需十分之一成本的模型,对开发者而言已是截然不同的产品。

随着 AI Agent 从偶尔调用走向持续运行,单次调用的成本会被持续放大。在这一背景下,OpenAI 的目标不只是「模型变得更强」,而是让同等智能以更低成本跑起来,从而支撑更大规模的真实任务部署。

信源