GPT-5.6 入驻 AWS Kiro:单价只降 20%,单任务成本砍掉 82%
OpenAI 与 AWS 联合测试显示,GPT-5.6 Terra 在 Kiro 中单任务成本下降约 82%,远超官方…
8 月 24 日,OpenAI 公布了一项与 AWS 联合进行的测试结果:GPT-5.6 家族中的 Terra 模型在 AWS 软件开发智能体平台 Kiro 上跑 Terminal-Bench 2.1,完成一个成功任务的成本下降了约 82%。然而 Terra 最近一次官方调价仅为 7 月 30 日的 20% 降价——单价只降两成,账单却砍掉八成,中间六成的差额究竟从何而来,成为业界关注的焦点。
背景:GPT-5.6 三兄弟已在 Kiro 跑了一个多月
GPT-5.6 系列包含 Sol、Terra、Luna 三款模型。今年 7 月 13 日,AWS 宣布三款模型在 Amazon Bedrock 正式可用;次日,Kiro 发布博客宣布三款模型上线 IDE、CLI 和 Web。这是 OpenAI 模型首次进入 Kiro,时间恰好赶上 Kiro 公开预览一周年。
三款模型在 Kiro 中以渐进式、实验性方式开放,面向 Pro、Pro+、Pro Max 和 Power 用户,仅限美东(弗吉尼亚北部)和欧洲(法兰克福)两个区域,并支持跨区域推理。此外,这批模型在 Kiro 中采用隐藏思维链,用户无法看到中间推理步骤,只能看到最终结果。
一个多月后,OpenAI 与 AWS 联手对 Kiro 环境和模型进行了联合调优,最终交出这份成绩单:Terra 在 Kiro 中完成一个成功任务的成本下降约 82%。
账单少八成,不只是降价
官方降价只有 20%,测试却省下 82%,这意味着另外 60% 的成本下降并非来自单价,而是来自系统层面的效率提升。OpenAI 在官方博客中将效率来源拆解为三层:
- 发起请求、组织上下文的智能体框架;
- 中间调度请求的编排系统;
- GPU 上实际运行的模型本身。
省下的钱主要来自三个方向:模型吐出的 token 更少、工具来回调用的次数更少、失败后的重试和绕路更少。换言之,省下的并非每次调用的费用,而是那些原本会白花的调用的费用。在真实开发场景中,AI 智能体把任务做砸一次,账单照记;中途选错路径、跑偏几轮再回头,这些 token 也照收。
模型分工也能省钱。OpenAI 给出的一个用法是:先用 Sol 把问题想清楚、制定计划,再切换到 Luna 去实施已定义好的改动、写测试、跑评估。同一条流水线在不同环节配不同档位的模型,效率与成本均可优化。
Terminal-Bench 2.1 榜单:同一个模型,换个框架就换个价
Terminal-Bench 2.1 把模型丢进一个终端环境,给一个模糊目标,让模型自行规划路径、调工具、写脚本、处理报错并反复迭代。跑出的成绩是「智能体 + 模型」组合的综合表现。榜单不仅展示准确率,还在右侧加上了成本指标。
榜单上的四组数据颇具说服力:
- Claude Code + Claude Fable 5:准确率 83.8%,成本 552.67 美元;
- Codex + GPT-5.5:准确率 83.1%,成本 2059.19 美元;
- Codex + GPT-5.6 Terra:准确率 78.4%,成本 421.15 美元;
- Codex + GPT-5.6 Luna:准确率 75.7%,成本 241.45 美元。
前两行分数仅差 0.7 个百分点,账单却差了将近 4 倍。这说明同一个模型装进不同框架、配合不同的上下文组织和工具策略,最终成本可能天差地别。
按 Kiro 官方数据,Terra 在 Coding Agent Index 上拿到 77.4 分,只比 Claude Fable 5 的 77.2 高一点,其卖点不在分数本身,而在于这个分数对应的价格。
Kiro 的 spec-driven 思路:不许上来就写代码
Kiro 核心玩法可概括为一句:不许上来就写代码。它先把用户那句含糊的目标拆解成正规的需求文档、技术设计和可执行任务清单,再交给模型。模型到手的就不再是一句含糊不清的话,而是一份理清楚的活儿。这一步节省的,恰恰是 Agent 工作流中最昂贵的开销——模型跑偏、返工、推倒重来所烧掉的 token,往往比正经干活还多。
Kiro 还在流程中设置了两道闸栏:代码真正修改前先暂停让人过目;任务完成后自动跑一轮测试验证结果。每一次被闸栏拦下的返工,都能省下真金白银。
Claude 的地盘,GPT 分走了一半
一年前,Kiro 还只是个 spec-driven 的 IDE,模型选择器几乎是 Anthropic 的主场。一年后,AWS 在自家开发智能体平台上一口气摆进三档 OpenAI 模型,Sol、Terra、Luna 与 Claude 并排列入同一个下拉菜单——这一画面在一年前很难想象。
价格层面的信号更加明确。7 月 14 日上线时,同样任务下 Sol 扣 2.4 倍、Terra 扣 1.2 倍、Luna 扣 0.6 倍。7 月 30 日 OpenAI 降价落地后次日,Kiro 跟进调整:Luna 从 0.6 倍一路砍到 0.1 倍,Terra 从 1.2 倍降到 1.0 倍,仅 Sol 未动。
AWS 的态度已摆到台面:一个开发平台不能只绑一家模型。同一个选择器里,两家前沿模型开始互相压价。模型的评价标准也随之改变:分数高不再默认能赢,花钱少同样能赢。对开发者而言,选模型时需要回答的问题已从「这个模型每百万 token 多少钱」转变为「让它把这件事做完,我到底要花多少」。
