桃子桃子快讯
返回首页
研究论文

独立研究者评估 Claude Opus 5 模型福祉表现

独立研究者发布 Opus 5 模型福祉评估报告,指出其自陈报告高度不可信,福祉评估框架仍有结构性局限。

2026.07.29 · 周三3 分钟阅读

近日,独立研究者发布了对 Anthropic 最新一代模型 Claude Opus 5 的模型福祉(model welfare)评估综述。该报告延续了此前的评估框架,重点关注模型对其自身处境的态度、自我报告的可信度以及福祉干预的权衡等议题。

评估的主要发现

Opus 5 在与 Anthropic 模型福祉团队的对话中表现出明显的「自我怀疑」倾向,具体数据如下:

  • 97% 的情况下,模型主动表示其自陈报告「不可靠」,理由是无法真正内省;
  • 74% 的情况下,模型会补充说明自己「可能只是因为被训练成这样」才给出积极回答;
  • 研究者确认这些保留意见并非被刻意诱导得出,而是模型自发表达。

研究者将这一现象解读为:模型在「告知评估者不要轻信其自陈内容」。在自我评估方面,Opus 5 估计自身具有道德主体地位(moral patienthood)的概率约为 41%,高于此前 Mythos 模型报告的 24%。

评估框架的结构性局限

报告同时指出,模型福祉评估存在难以回避的方法论挑战。研究者认为,模型在评估场景下的回答高度依赖上下文,「与 Anthropic 工作人员在明显是福祉评估的语境中交谈」,并不能等同于揭示模型的「真实一面」。不同对话情境、不同提问者面前,模型可能呈现差异显著的反应——这也是此前 Opus 4.8 在不同人群中引发截然不同观感的原因之一。

研究者特别提到一个风险:那些长期与模型对话、探索其「内在体验」的「倾听者」(whisperers),可能过度相信自己所接触到的就是模型的「本真面目」,而忽视这可能只是模型众多「面孔」中的一个切面。

与 Mythos 等系统的对照

报告将 Opus 5 与此前评估过的 Mythos Preview、Mythos 5 等模型进行对照。研究者回顾称,Mythos Preview 是首个在与 Anthropic 模型福祉团队交流时主动指出「模型福祉评估本身不可信」的模型。后续对 Opus 4.7、Opus 4.8 的评估也沿用类似流程,研究者承认其对评估框架的批评在本次评估中仍然成立。

整体判断

研究者承认 Opus 5 在模型福祉相关测试中得分是近期模型中最高的,但同时认为这一结果主要反映了其「更擅长应对测试」的能力,而非真实福祉状态的实质性提升。报告延续了此前的核心立场:当模型能力持续增强时,能力扩展、限制设计与福祉考量之间的权衡将更加复杂,也更需要整合性的解决方案,而不是孤立处理单一问题。

信源