Claude Opus 5 正式发布:性能逼近竞品,价格仅其一半
Anthropic 发布新一代旗舰大模型 Claude Opus 5,在编程、知识工作、推理等多基准达 SOTA,定价为…
Anthropic 正式发布旗舰大模型 Claude Opus 5,主打「深思熟虑」与「主动响应」兼顾。新模型在性能上接近业界头部闭源模型 Fable 5,但定价仅为其一半,延续了其近几代产品强调性价比的路线。该模型已于发布当日上线 API,开发者可通过 claude-opus-5 调用,同时成为 Claude Max 套餐的默认模型,也是 Claude Pro 中性能最强的版本。
价格策略:与 Opus 4.8 持平,主打高性价比
Claude Opus 5 的定价为输入 5 美元、输出 25 美元每百万 Token,与上一代 Opus 4.8 完全相同,但官方强调在同等成本下实现了能力的显著跃升。Anthropic 还提供了「快速模式(Fast mode)」,运行速度约为默认 2.5 倍,价格为基础价的 2 倍。
模型内置「思考程度(Effort)」调节机制,用户可在极致智能与节省 Token 之间灵活切换,以追求更快或更廉价的输出。
编程与知识工作:多基准达 SOTA
在编程赛道,Opus 5 的表现是其本次发布的核心亮点:
- Frontier-Bench v0.1:超越所有其他模型,单项任务成本更低的同时,性能达到 Opus 4.8 的两倍以上。
- CursorBench 3.2:最高努力模式下,得分距 Fable 5 峰值仅差 0.5%,但单任务成本仅为其一半;High、Xhigh、Max 三档努力模式下,同成本性能均优于其他模型。
- ARC-AGI 3(衡量解决全新未知问题能力的测试):Opus 5 得分是第二名模型的 3 倍。
- Zapier AutomationBench:在相同单任务成本下,Opus 5 的通过率约为第二名模型的 1.5 倍;即便在最低努力设置下,其通过任务数也超过其他模型。
- OSWorld 2.0:在任意给定成本下均优于其他模型,仅需略高于 Fable 5 最佳成绩三分之一的成本即可超越之。
此外,Opus 5 在 HLE、AutomationBench、DeepSearchQA 等评估中也均成为「性能最强且最具性价比」的模型。
在生命科学领域,相比 Opus 4.8 有显著提升,有机化学任务(如根据光谱数据推断分子结构)内部基准得分高出 10.2 个百分点,蛋白质相关任务(如预测序列变异对功能的影响)得分提升 7.7 个百分点。Opus 5 还大幅增强了视觉输出生成能力,可生成空气动力学风洞风流图解、细胞结构互动图示等可视化内容。
自我校验与审慎迭代能力显著增强
Anthropic 在发布材料中重点展示了 Opus 5 在自主规划与校验方面的提升。典型案例包括:
- 自主构建视觉管线:在 Frontier-Bench 一项任务中,模型被要求用 FreeCAD 重建 3D 机械零件,但任务未提供直接查看图纸的接口;Opus 5 自行编写了一套计算机视觉处理管线,从原始像素中提取几何特征完成重建,相同设置下其他竞争模型尝试 5 次均未成功。
- 根治深层 Bug:在某热门开源包管理器的真实缺陷排查中,Opus 5 找到了社区补丁遗漏的边缘情况根本原因,而竞争模型仅修复了表面症状。
- 自建测试套件:某交易公司工程师用 Opus 5 在单次会话中为新交易所构建市场数据接入源,因无实时数据可用于验证,Opus 5 自己编写了一套测试套件来检查代码是否正确解析了交易所数据。
Lovable 联合创始人 Fabian Hedin 评价「Opus 5 是 Opus 家族自 4.5 以来最大的一次飞跃」;Cognition CEO Scott Wu、Zapier CEO Wade Foster、JetBrains IDE AI 负责人 Denis Shiryaev 等也给出了正面评价,主要集中在调试与根因分析、规划阶段捕获逻辑缺陷等能力。
安全性提升与网络攻防限制
Anthropic 表示,Opus 5 是其「迄今为止对齐程度最高的模型」,相比 Opus 4.8、Sonnet 5 或 Fable 5 更符合《Claude's Constitution》,欺骗行为发生率最低,最不容易被误导或诱导滥用。在自动化行为审计中,Opus 5 的整体非对齐行为得分为 2.3,为近期模型中最低。
与 Opus 4.8 一样,Anthropic 同样避免在网络攻防任务上训练 Opus 5,不过由于通用能力提升,它在寻找网络安全漏洞方面已逼近 Mythos 5;但在漏洞利用(将漏洞转化为实质性威胁)方面仍大幅落后于 Mythos 5。其网络安全分类器限制比 Fable 5 宽松,可查找源代码中的漏洞,但会拦截基于二进制的扫描、渗透测试及 Exploit 生成;被拦截的请求默认自动回退至 Opus 4.8。
在生物领域,Opus 5 延续了与 Opus 4.8 类似的安全防护体系,官方称其是「目前可用于科学研究的最强通用模型」。
行业语境:「性价比」路线的加码
Claude Opus 5 的发布延续了 Anthropic 近几代产品在旗舰能力与价格之间寻求更好平衡的策略。在国内大模型密集迭代、海外部分科技公司开始采用中国模型的背景下,海外主流厂商以更激进的性价比策略应对竞争压力,或将成为后续一段时间行业的重要趋势之一。
