桃子桃子快讯
返回首页
产品功能

OpenAI GPT-5.6 三款模型登陆 Amazon Bedrock,引入显式 Prompt 缓存

OpenAI GPT-5.6 Sol、Terra、Luna 正式上线 Amazon Bedrock,配套推出显式 Pro…

2026.07.31 · 周五3 分钟阅读

OpenAI 最新一代模型 GPT-5.6 系列正式登陆 Amazon Bedrock 平台,三款变体分别面向复杂推理、日常生产和大规模轻量任务,并首次在该平台引入显式 Prompt 缓存,缓存输入可享 9 折优惠。

三款模型与定位

GPT-5.6 在 Amazon Bedrock 上提供 Sol、Terra、Luna 三档能力分层:

  • GPT-5.6 Sol:面向最复杂的推理与 agentic 编码任务
  • GPT-5.6 Terra:用于日常均衡的生产负载
  • GPT-5.6 Luna:面向分类、摘要等高频、低延迟任务

计费采用按 token 付费模式,使用量计入已有的 AWS 承诺消费,同时受 AWS 既有安全与治理策略约束,企业可在不切换平台的前提下调用 OpenAI 前沿模型。

显式 Prompt 缓存

GPT-5.6 在 Bedrock 上首次支持显式 Prompt 缓存,开发者可自行标记缓存边界,精确控制 prompt 中的哪些片段在多次请求间复用:

  • 缓存输入按 9 折计费
  • 单次缓存有效期 30 分钟
  • 对 agentic 工作流收益最大:系统指令、工具定义、参考文档往往在多次调用中重复出现

Bedrock 同时保留隐式缓存模式,由平台自动放置缓存断点。两种模式可按业务场景选用:隐式模式适合通用负载,显式模式适合需要稳定命中关键前缀的高复用工作流。

接入与推理控制

接入推荐使用 AWS 短期 bearer token 进行认证,配合 OpenAI SDK 调用 Bedrock 的 bedrock-mantle 端点。三个模型 ID 分别为 openai.gpt-5.6-sol、openai.gpt-5.6-terra、openai.gpt-5.6-luna,请求通过 OpenAI 兼容的 Responses API 完成。

关键能力要点:

  • 推理强度(reasoning effort)支持 none、low、medium、high、xhigh 五档,默认 medium;调高消耗更多推理 token,none 档追求最低延迟
  • 支持流式响应、严格 JSON Schema 结构化输出与函数调用
  • temperature、top_p 仅在 reasoning.effort 为 none 时生效,其他档位由模型自身控制输出方差

区域可用性与迁移建议

区域分布情况:

  • GPT-5.6 Sol:US East(N. Virginia)、US East(Ohio)
  • GPT-5.6 Terra、Luna:在上述区域外另增加 US West(Oregon)

从 GPT-5.5 或更早版本迁移时,建议先沿用当前推理强度,再尝试下调一档——官方表示 GPT-5.6 的 token 利用率更高,多数负载在更低档位下仍可保持输出质量。

信源