研究论文
Anthropic 论文:AI 可自动改进大模型对齐训练
Anthropic 发布论文,AI 系统可在 6 小时内自动改进模型对齐效果,成本仅为人类研究员的约 1/37。
2026.08.29 · 周六约 3 分钟阅读
Anthropic 于周五发布了一篇题为《Automated Researchers Can Reliably Mitigate Alignment Failures》的论文,首次系统性地展示了 AI 系统自动改进大模型对齐训练的能力。这项由 Anthropic Fellow 陈约汉(Chen Yueh-Han)主导的研究,为「自动化对齐后训练在近期内有望变得实用」提供了早期证据。
系统如何工作
研究团队将这套系统命名为 Automated Alignment Researcher(AAR),其运作流程在很大程度上复刻了人类研究员的研究方式:
- 在已有学术文献中检索潜在改进方向
- 基于文献提出具体的训练方法
- 用该方法训练模型 30 分钟,并在多轮迭代中逐步提升 benchmark 表现
- 保留有效方法、淘汰无效方案,从而在保证速度的前提下大规模运行
关键实验结果
研究团队为系统设置了 10 项针对特定不对齐行为的 benchmark,结果相当亮眼:
- AAR 在全部 10 项 benchmark 上均提升了模型表现
- 同时未损害模型的通用能力
- 论文原文写道:「最佳 AAR 方法在平均 6 小时内就能超越资深人类研究员提出的方案」
- 进一步指出:「由人类引导的研究方向并未带来更强的表现」
成本对比
论文还附上了一个直观的成本对比,对自动化方案的「经济性」做了量化说明:
- AAR 通过 API 推理运行,成本约 4 美元/小时
- Anthropic 付给人类研究员的时薪为 150 美元/小时
- 两者相差约 37 倍
局限与不足
研究团队也坦率地列出了当前方案的若干局限:
- 系统表现依赖于 benchmark 是否真实反映实际对齐目标
- benchmark 本身的建立、维护与更新仍是开放难题
- 自动化系统赖以学习的文献需要持续扩充,否则其能力将受到制约
迈向递归自我改进
该研究被外界视为通往「递归自我改进」(recursive self-improvement)的一步。一旦模型能够自动优化自身的对齐训练流程,更广义地优化训练实践也将变得可能——届时,人类 AI 研究员的部分工作可能被自动化系统部分取代。不过,论文的态度较为审慎,强调这只是对齐研究中的一条新路径,而非终极方案。
