桃子桃子快讯
返回首页
模型发布

Anthropic 发布 Claude Opus 5.5:编码与计算机使用刷新 SOTA

Anthropic 推出 Claude Opus 5.5,在编码与计算机使用任务上刷新 SOTA,每任务成本较前代下降约…

2026.09.23 · 周三3 分钟阅读

Anthropic 旗下旗舰模型 Claude Opus 5.5 于今日正式上线,主打「agentic coding(智能体编码)」与 computer use(计算机使用)两大方向。多方实测显示,Opus 5.5 在编码基准上刷新 SOTA,同时将单任务成本压到前代的约三分之一到一半区间,成为 Anthropic 当前在企业级编码场景中的主力旗舰。

发布概览

Anthropic 在官方 X 账号确认:「Claude Opus 5.5 is available today.」同步上线的还包括 Cursor、Perplexity 等头部 AI 产品:

  • Cursor 已在编辑器中接入 Opus 5.5,作为 Max 档推理模型使用。
  • Perplexity 将其设为 Computer 产品的 Standard effort level 默认模型。
  • 测试机构 TestingCatalog 指出,Opus 5.5 在 agentic coding 与 computer use 任务上达到新 SOTA,并出现「指数级放缓」的推理行为模式,引发社区关注。

基准与成本数据

来自 Cursor 与 Perplexity 的实测数据,为 Opus 5.5 的能力与定价提供了量化参考:

  • CursorBench:在 Max effort 设置下得分 57.8%,为该基准当前最高成绩;每任务成本较 Opus 5 下降约 40%。
  • Perplexity WANDR benchmark:得分 0.610,单任务成本约 4.13 美元;据 Perplexity 自述,相较其此前的 Claude 系列模型(来源原文写作「Claude Fable 5.1」,疑为转写误差),性能略有提升,同时单任务成本下降 67.6%。

两组数据虽来自不同基准(编码任务 vs. 计算机使用任务),但共同指向同一结论:Opus 5.5 在保持或提升能力上限的同时,把经济性显著拉低。

行业意义与待观察点

对编码智能体赛道而言,Opus 5.5 的发布意味着头部厂商之间的「性能—成本」竞争进一步白热化:

  • 对开发者:单任务成本下降 40%–68% 直接降低 Agent 类产品的调用门槛,长链路工作流变得更具商业可行性。
  • 对竞品:GPT、Claude Sonnet 系列以及开源编码模型需要在能力或价格上做出回应。
  • 待确认信息:完整模型卡、上下文窗口、多模态覆盖范围、API 限速策略尚未在本次公开信息中披露,社区与开发者社区预计将在随后几天补充更多实测。

综合来看,Claude Opus 5.5 是 Anthropic 在 2025 年下半年的一次关键旗舰迭代,定位明确指向「更便宜、更能干」的 agentic 编码与计算机使用场景,后续的 API 价格表与功能开放节奏值得持续跟踪。

信源