桃子桃子快讯
返回首页
研究论文

Anthropic 论文:AI 可自动改进大模型对齐训练

Anthropic 发布论文,AI 系统可在 6 小时内自动改进模型对齐效果,成本仅为人类研究员的约 1/37。

2026.08.29 · 周六3 分钟阅读

Anthropic 于周五发布了一篇题为《Automated Researchers Can Reliably Mitigate Alignment Failures》的论文,首次系统性地展示了 AI 系统自动改进大模型对齐训练的能力。这项由 Anthropic Fellow 陈约汉(Chen Yueh-Han)主导的研究,为「自动化对齐后训练在近期内有望变得实用」提供了早期证据。

系统如何工作

研究团队将这套系统命名为 Automated Alignment Researcher(AAR),其运作流程在很大程度上复刻了人类研究员的研究方式:

  • 在已有学术文献中检索潜在改进方向
  • 基于文献提出具体的训练方法
  • 用该方法训练模型 30 分钟,并在多轮迭代中逐步提升 benchmark 表现
  • 保留有效方法、淘汰无效方案,从而在保证速度的前提下大规模运行

关键实验结果

研究团队为系统设置了 10 项针对特定不对齐行为的 benchmark,结果相当亮眼:

  • AAR 在全部 10 项 benchmark 上均提升了模型表现
  • 同时未损害模型的通用能力
  • 论文原文写道:「最佳 AAR 方法在平均 6 小时内就能超越资深人类研究员提出的方案」
  • 进一步指出:「由人类引导的研究方向并未带来更强的表现」

成本对比

论文还附上了一个直观的成本对比,对自动化方案的「经济性」做了量化说明:

  • AAR 通过 API 推理运行,成本约 4 美元/小时
  • Anthropic 付给人类研究员的时薪为 150 美元/小时
  • 两者相差约 37 倍

局限与不足

研究团队也坦率地列出了当前方案的若干局限:

  • 系统表现依赖于 benchmark 是否真实反映实际对齐目标
  • benchmark 本身的建立、维护与更新仍是开放难题
  • 自动化系统赖以学习的文献需要持续扩充,否则其能力将受到制约

迈向递归自我改进

该研究被外界视为通往「递归自我改进」(recursive self-improvement)的一步。一旦模型能够自动优化自身的对齐训练流程,更广义地优化训练实践也将变得可能——届时,人类 AI 研究员的部分工作可能被自动化系统部分取代。不过,论文的态度较为审慎,强调这只是对齐研究中的一条新路径,而非终极方案。

信源