桃子桃子快讯
返回首页
模型发布

Claude Opus 5.5 发布:多基准跑分登顶,缓存读取价砍六成

Anthropic 推出 Claude Opus 5.5,多项编程与知识工作基准夺第一,API 输入输出价降 20%,缓…

2026.09.23 · 周三6 分钟阅读

Anthropic 于 9 月 23 日正式发布旗舰模型 Claude Opus 5.5,在 Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 等多项编程基准上跑分登顶,输出速度较 Opus 5 提升 30% 以上。模型同步下调 API 输入输出价格,并将缓存读取价格直接砍掉六成,以「性价比」姿态正面竞争 OpenAI 的 GPT-6 Astra 与 GPT-5.6 Sol。

编程基准全面领跑

在衡量复杂命令行任务能力的 Terminal-Bench 4.0 上,Opus 5.5 拿下 66.4%,超过 Opus 5 的 52.3%、GPT-6 Astra 的 57.9% 与 Claude Fable 5.1 的 55.8%,差距明显。在 FrontierCode v1.1 上,Opus 5.5 以 54.4% 略胜 GPT-6 Astra 的 53.3%。值得注意的是,在推理 effort 中档(默认)下,Opus 5.5 反而跑出 54.6%,超过所有模型最高档成绩。

CursorBench 4.0 考察真实 Cursor 会话中的多文件模糊任务,最高 effort 下 Opus 5.5 拿到 57.8%,比 Fable 5.1(51.8%)高 6 分,比 GPT-5.6 Sol(41.7%)高 16.1 分。中档设置下 Opus 5.5 得分 52.5%,仍领先 GPT-5.6 Sol 最高成绩约 11 分,单项任务成本约为后者的三分之一。

大规模代码库迁移成亮点

Opus 5.5 强调在代码库级别的任务上有显著提升。早期测试者使用它迁移 68 万行代码,不到一天完成,而人类工程团队预计需要数周。另一名测试者用它审计并修复一个 20 万行代码库,耗时不到 3 小时;同样的任务 Opus 5 花了超过 20 小时,Token 消耗还是 2.5 倍。

Anthropic 内部测试中,让 Opus 5.5 与 Fable 5.1 分别将 HAProxy 从 C 语言重写为 Rust,两者均通过几乎全部 HAProxy 回归测试,但 Opus 5.5 仅用 9.5 小时,Fable 5.1 用了 12 小时,成本低了 51%。

API 价格分层调整

Opus 5.5 输入价为每百万 Token 4 美元、输出价 20 美元,相比 Opus 5 均下降 20%。结合任务步骤与 Token 用量减少,Anthropic 测算典型任务总成本可下降 40%。

真正的大刀落在缓存读取价:从 Opus 5 的 0.50 美元/百万 Token 直接降至 0.20 美元,降幅 60%。长对话与大型代码任务需要反复读取上下文,缓存读取往往占成本大头,这项调整对 Agent 编程场景感知更强。

此外新增 Fast 模式,输出速度最高可达标准模式 2.5 倍,价格相应翻倍至输入 8 美元、输出 40 美元/百万 Token,适合对延迟敏感的场景。订阅侧的 Pro、Max、Team 与按席位收费企业版五小时使用限额一并提升,并新增一次由用户自选时机的 rate limit reset。

知识工作与表达风格改进

在覆盖 44 个职业的 GDPval-AA v2.1 评估中,Opus 5.5 拿到 1846 Elo,超过 Fable 5.1(1735)与 Opus 5(1708)。默认 effort 下即超过 GPT-6 Astra 最高 effort 表现,单项任务成本约为后者五分之一。

投资公司 Walleye Capital 反馈,Opus 5.5 在最低设置下即基本完成其量化研究评测任务;调高 effort 后还主动发现评测指令中的 off-by-one 错误并修正,模型甚至备注「处理正确但可能被评分器扣分」。此前测试过的所有模型均未发现该问题。

表达风格上,Opus 5.5 把最重要信息放在前面再解释原因。例如 billing 系统 Bug 对比中,模型开头即点明「额外减少的 9.92 美元来自一个 Bug,免费层调整只占 1.50 美元」,再说明是哪次代码重构漏掉了每月最后一天的大部分用量。早期测试者评价:「它写东西的方式跟我一样。」

安全护栏与「放缓前沿」

Opus 5.5 是首款同时搭载 Fable 5.1 同级网络安全、生物安全与反蒸馏护栏的 Opus 模型,相关限制触发后系统会透明回退至其他模型处理。发布前接受了 METR 与 Frontier Design 两家外部机构评估。

在内部近 2000 个模拟场景的自动化行为审计中,Opus 5.5 在几乎所有失调行为指标上拿到近期 Claude 模型最好成绩;越界倾向评估中尝试频率比 Opus 5 与 Claude Mythos 5.1 低约 85%。在编程、工具调用、计算机操作与网页浏览等提示注入场景中,Opus 5.5 追平或超过 Opus 5。

不过 Anthropic 也承认,Opus 5.5 经常怀疑自己正在接受评估,这意味着测试表现能否代表真实部署仍存疑。反蒸馏方面,模型搭载 preserved thinking 机制,限制 API 用户编辑此前生成的思考上下文(适用于 2026 年 8 月 31 日及以后创建的账户),thinking 模式不再允许关闭,输出文本中加入不可见水印。

后续:Sonnet 5.5 与 Haiku 5.5

Anthropic 宣布 Sonnet 5.5 与 Haiku 5.5 都将在未来几周内推出,同样会获得性能、效率与安全方面的升级。Opus 5.5 只是 5.5 系列的第一款,OpenAI 刚刚端出 GPT-6 Astra 与 GPT-5.6 Sol,Anthropic 紧随其后并预告还有两款排队,前沿节奏并未放缓。

信源