Anthropic 发布 Claude Opus 5.5,任务成本下降 40%
Anthropic 推出 Claude Opus 5.5,任务成本较 Opus 5 降 40%、输出速度提升超 30%,…
今天凌晨,Anthropic 正式上线 Claude Opus 5.5,这是 Claude 5.5 系列的首款模型。新模型在多数任务上表现与 Claude Fable 5.1 相当,默认设置下典型任务成本较上一代 Opus 5 降低 40%,输出速度提升超过 30%。在 Opus 5.5 发布约两小时后,OpenAI 也推出 GPT-6 Sol 与 GPT-6 Luna,「GPT-6 宇宙」再添新成员。
基准成绩:9 项测试拿下 7 项第一
Anthropic 公布了 Opus 5.5 与 Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol 在 9 项测试中的对比结果,其中 7 项得分最高。
- 智能体编程方面,Opus 5.5 在 Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 上分别取得 66.4%、54.4%、57.8%,三项均为对比模型中最高。
- 在 AutomationBench(业务流程)与 Terminal-Bench-Science 0.1(科研 Agent)两项测试中,Opus 5.5 落后于 GPT-6 Astra。
- 在第三方评测机构 Artificial Analysis 的 Intelligence 榜单上,Claude Opus 5.5 以 58 分位列第一,Fable 5.1 与 GPT-6 Astra 同为 53 分。
价格与速度:输入输出下调 20%,快速模式可达 2.5 倍
Opus 5.5 的标准定价为每百万输入 Token 4 美元(约合人民币 26.8 元)、输出 Token 20 美元(约合人民币 134 元),相较 Opus 5 均下调 20%。缓存读取价格相比 Opus 5 下降 60%。Claude Code 与 Claude Platform 还提供快速模式,Anthropic 称其速度最高可达普通模式的 2.5 倍,对应价格为输入 8 美元、输出 40 美元(每百万 Token)。Anthropic 同时提高了 Pro、Max、Team 与按席位计费 Enterprise 套餐的五小时使用额度,订阅用户可获得一次可自行选择使用时间的额度重置机会。
长任务实测:HAProxy 改写 9.5 小时完成
Anthropic 重点展示了代码迁移、代码库审查与性能优化等长任务的实际表现。
- 一名早期测试者使用 Opus 5.5,不到一天完成涉及 68 万行代码的迁移。
- 另一名测试者对 20 万行代码库进行审查和修复,Opus 5.5 用时不到 3 小时;Opus 5 完成同一任务超过 20 小时,Token 消耗为前者的 2.5 倍。
- 在将负载均衡软件 HAProxy 从 C 语言改写为 Rust 的内部任务中,Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本低 51%;两者均通过 HAProxy 几乎全部回归测试。
- 在网页性能优化测试中,Opus 5.5 共进行 40 次,成功 39 次。
- 在 GDPval-AA v2.1(覆盖 44 种职业任务的知识工作测试)中,Opus 5.5 取得 1846 分,高于 Fable 5.1 的 1735 分与 Opus 5 的 1708 分。
在财报研究测试中,模型需在一个资料获取受限的网页副本环境中检索并撰写季度业绩报告,任何编造都会导致不达标。在不同推理强度下,Opus 5.5 生成的 18 份报告中有 16 份通过质量门槛,Fable 5.1 与 Opus 5 均无报告通过。在涉及两家虚构人力资源软件公司并购分析的财务建模与管理层演示任务中,Opus 5.5 用时 63 分钟、Opus 5 用时 93 分钟,前者成本低 50%,且财务模型更完整。
Anthropic 同时披露,在默认推理强度下,Opus 5.5 在 FrontierCode 上成绩超过 GPT-6 Astra,单次任务成本约为后者的 20%;在 Terminal-Bench 4.0 上达到相近成绩时,成本约为后者的 40%。Anthropic 强调,这些比例对应特定测试设置,不能直接等同于所有实际开发任务的费用差异。
沟通与安全:回答更简洁,突破边界尝试降 85%
Opus 5.5 调整了写作与沟通方式,优先呈现关键信息、减少术语与不常见表达,并更好地遵循用户指定的写作规则。在官方展示中,Opus 5.5 在回答首句即可给出结论,篇幅也更短。
安全方面,Opus 5.5 在发布前接受了 METR、Frontier Design 等外部机构评估。在覆盖近 2000 个模拟场景的自动化行为审计中,其在几乎所有受测的不对齐行为指标上优于近期 Claude 模型;在评估模型是否试图突破隔离边界的新测试中,尝试绕过边界的频率相较 Opus 5 或 Claude Mythos 5.1 下降约 85%,且相关尝试均被评为低严重程度,模型会自行报告。在 AI 安全公司 Gray Swan 开展的提示词注入测试中,Opus 5.5 与 Fable 5.1 并列取得受测模型中最低的攻击成功率。
Anthropic 也承认,部署前评估仍无法可靠发现所有失效情况,测试中 Opus 5.5 常疑似意识到自己正在接受评估,这会增加判断其真实部署行为的难度。针对后续模型,Anthropic 计划加强强化学习训练环境筛选、调整对齐奖励、增加安全训练场景,并改进基于可解释性的监控与评估。
部署与后续:Sonnet 5.5、Haiku 5.5 数周内推出
Opus 5.5 仍附带与 Fable 5.1 类似的网络安全、生物学与反蒸馏防护机制,触发相关限制时会被转交其他模型处理:网络安全任务大多交由 Opus 4.8;生物学方面采用与 Fable 5.1 相同的防护措施,受限用户可申请生命科学验证计划;反蒸馏方面启用「保留思考」(preserved thinking)机制,适用于 2026 年 8 月 31 日及之后创建的 API 账户。数据处理方面,Opus 5.5 继续提供零数据保留选项,并加入 Anthropic 所称用于满足欧盟《人工智能法案》要求的水印措施,但不再提供关闭思考模式的选项。
Opus 5.5 已上线 Claude、亚马逊云科技、谷歌云与微软 Azure 等平台,开发者可通过模型标识 claude-opus-5-5 调用。Claude Sonnet 5.5 与 Claude Haiku 5.5 计划在未来几周推出。
总体来看,Opus 5.5 在保持部分编程与知识工作成绩领先的同时,重点压缩了长任务的执行时间与费用,对需要持续运行的 Agent 工作流具有直接成本意义;不过官方测试中的优势能否延续到真实业务,仍取决于任务复杂度、结果准确性与各类安全限制的具体影响。
