桃子桃子快讯
返回首页
行业动态

Anthropic 对齐研究人员公开警告未来模型潜在风险

Anthropic AI 对齐研究人员公开表达对具备 RSI 能力未来模型的担忧,相关言论引发行业广泛讨论。

2026.09.09 · 周三2 分钟阅读

Anthropic 专注于 AI 对齐(alignment)研究的研究人员近日在社交平台公开发声,呼吁业界关注未来模型可能具备的 RSI(递归自我改进,Recursive Self-Improvement)能力所带来的风险。其中一句引发广泛传播的观点直言:「我们真的由衷地相信 AI 可能杀死全人类,我个人认为未来十年内发生这一情景的概率超过 10%。」另一位研究者则批评道:「没有一家公司在认真负责任地行事。」

言论核心内容

两位研究人员分别从概率判断与行业行为两个角度提出了警示:

  • 一人以量化方式估计了 AI 导致人类灭绝级别的灾难性风险,认为十年内发生概率超过 10%;
  • 另一人则对当前 AI 公司的安全治理态度表达了不满,指出行业整体缺乏负责任的行动。

TestingCatalog 在转发时评价,这两段推文「可能是整个人类历史上最重要的文字」,并呼吁社区进一步放大该信号。值得注意的是,该账号同时承认「这一报道来得有些晚」,说明相关讨论在更早时段已经在 AI 安全社区内流传。

背景与语境

Anthropic 长期将 AI 安全与对齐作为公司核心研究方向之一,其创始团队包括多位此前参与 OpenAI 安全研究的人员。此次公开表态出现在以下行业语境中:

  • 头部实验室持续推进更大规模、更高能力的模型训练,能力提升速度引发安全社区担忧;
  • 全球范围内关于 AI 监管与前沿模型治理的讨论不断升温;
  • 「递归自我改进」被部分研究者视为通向超级智能(superintelligence)的潜在路径之一,其不可控性是对齐研究的核心难题。

信息局限

需要指出的是,本条资讯来自第三方账号 TestingCatalog 的转发与评论,原文并未提供两位研究人员的确切身份、完整推文链接或更多技术细节。因此,相关言论的具体语境、完整表述及发布时点尚需通过原始推文进一步核实。读者在引用此类观点时,建议结合原始来源进行交叉验证。

信源