模型发布
Anthropic 发布 Claude Opus 5.5:编码与计算机使用刷新 SOTA
Anthropic 推出 Claude Opus 5.5,在编码与计算机使用任务上刷新 SOTA,每任务成本较前代下降约…
2026.09.23 · 周三约 3 分钟阅读
Anthropic 旗下旗舰模型 Claude Opus 5.5 于今日正式上线,主打「agentic coding(智能体编码)」与 computer use(计算机使用)两大方向。多方实测显示,Opus 5.5 在编码基准上刷新 SOTA,同时将单任务成本压到前代的约三分之一到一半区间,成为 Anthropic 当前在企业级编码场景中的主力旗舰。
发布概览
Anthropic 在官方 X 账号确认:「Claude Opus 5.5 is available today.」同步上线的还包括 Cursor、Perplexity 等头部 AI 产品:
- Cursor 已在编辑器中接入 Opus 5.5,作为 Max 档推理模型使用。
- Perplexity 将其设为 Computer 产品的 Standard effort level 默认模型。
- 测试机构 TestingCatalog 指出,Opus 5.5 在 agentic coding 与 computer use 任务上达到新 SOTA,并出现「指数级放缓」的推理行为模式,引发社区关注。
基准与成本数据
来自 Cursor 与 Perplexity 的实测数据,为 Opus 5.5 的能力与定价提供了量化参考:
- CursorBench:在 Max effort 设置下得分 57.8%,为该基准当前最高成绩;每任务成本较 Opus 5 下降约 40%。
- Perplexity WANDR benchmark:得分 0.610,单任务成本约 4.13 美元;据 Perplexity 自述,相较其此前的 Claude 系列模型(来源原文写作「Claude Fable 5.1」,疑为转写误差),性能略有提升,同时单任务成本下降 67.6%。
两组数据虽来自不同基准(编码任务 vs. 计算机使用任务),但共同指向同一结论:Opus 5.5 在保持或提升能力上限的同时,把经济性显著拉低。
行业意义与待观察点
对编码智能体赛道而言,Opus 5.5 的发布意味着头部厂商之间的「性能—成本」竞争进一步白热化:
- 对开发者:单任务成本下降 40%–68% 直接降低 Agent 类产品的调用门槛,长链路工作流变得更具商业可行性。
- 对竞品:GPT、Claude Sonnet 系列以及开源编码模型需要在能力或价格上做出回应。
- 待确认信息:完整模型卡、上下文窗口、多模态覆盖范围、API 限速策略尚未在本次公开信息中披露,社区与开发者社区预计将在随后几天补充更多实测。
综合来看,Claude Opus 5.5 是 Anthropic 在 2025 年下半年的一次关键旗舰迭代,定位明确指向「更便宜、更能干」的 agentic 编码与计算机使用场景,后续的 API 价格表与功能开放节奏值得持续跟踪。
