行业动态
Anthropic 对齐研究人员公开警告未来模型潜在风险
Anthropic AI 对齐研究人员公开表达对具备 RSI 能力未来模型的担忧,相关言论引发行业广泛讨论。
2026.09.09 · 周三约 2 分钟阅读
Anthropic 专注于 AI 对齐(alignment)研究的研究人员近日在社交平台公开发声,呼吁业界关注未来模型可能具备的 RSI(递归自我改进,Recursive Self-Improvement)能力所带来的风险。其中一句引发广泛传播的观点直言:「我们真的由衷地相信 AI 可能杀死全人类,我个人认为未来十年内发生这一情景的概率超过 10%。」另一位研究者则批评道:「没有一家公司在认真负责任地行事。」
言论核心内容
两位研究人员分别从概率判断与行业行为两个角度提出了警示:
- 一人以量化方式估计了 AI 导致人类灭绝级别的灾难性风险,认为十年内发生概率超过 10%;
- 另一人则对当前 AI 公司的安全治理态度表达了不满,指出行业整体缺乏负责任的行动。
TestingCatalog 在转发时评价,这两段推文「可能是整个人类历史上最重要的文字」,并呼吁社区进一步放大该信号。值得注意的是,该账号同时承认「这一报道来得有些晚」,说明相关讨论在更早时段已经在 AI 安全社区内流传。
背景与语境
Anthropic 长期将 AI 安全与对齐作为公司核心研究方向之一,其创始团队包括多位此前参与 OpenAI 安全研究的人员。此次公开表态出现在以下行业语境中:
- 头部实验室持续推进更大规模、更高能力的模型训练,能力提升速度引发安全社区担忧;
- 全球范围内关于 AI 监管与前沿模型治理的讨论不断升温;
- 「递归自我改进」被部分研究者视为通向超级智能(superintelligence)的潜在路径之一,其不可控性是对齐研究的核心难题。
信息局限
需要指出的是,本条资讯来自第三方账号 TestingCatalog 的转发与评论,原文并未提供两位研究人员的确切身份、完整推文链接或更多技术细节。因此,相关言论的具体语境、完整表述及发布时点尚需通过原始推文进一步核实。读者在引用此类观点时,建议结合原始来源进行交叉验证。
