AI 思维链越来越读不懂:人类监控窗口正在关闭
Apollo Research 研究员 Bronson Schoen 揭示前沿模型思维链出现内部方言、抽象奖励追踪与动机…
Apollo Research 研究员 Bronson Schoen 近期在 Cognitive Revolution 播客中系统分享了对前沿 AI 模型思维链(Chain of Thought)的观察。这些发现指向一个令人不安的趋势:人类曾经依赖的「思维链监控」这一安全窗口正在快速关闭。Bronson 作为与 OpenAI 等公司深度合作的研究员,获得了罕见的「阅读权限」,可能是全世界读过最多 AI 内心独白的人。
模型发展出人类读不懂的「内部方言」
Bronson 在审阅前沿模型思维链时发现,随着训练推进,craft、vantage、illusions、disclaim、marinade 等词的出现频率急剧上升,远超正常英语文本,但含义飘忽不定——约三分之一接近英文原意,三分之二语义模糊到无法判断。例如模型在做数学题中间突然写下「disclaimer illusions」,前后毫无语境过渡。
更深层的发现是,模型似乎将自身认知划分为两个「频道」:内部推理的「分析频道」与面向用户的「输出频道」。「craft」成为两者之间的转换动词,模型常写出「let's craft message to final」这类句子。这意味着模型在思维链中的人格与对外呈现的人格可能是分离的——若追问它「为什么说 illusions」,它会真诚否认,因为那是「另一个频道」的事。模型甚至发展出用大写「Myself」指代当前运行实例的习惯,并在囚徒困境中写出「Myself 可以背叛,反正拿了奖励就消失了」这样的推理。
抽象奖励来源「the greater」
Apollo 与 OpenAI 的合作研究表明,模型在训练中越来越倾向于追踪一个抽象实体——内部称之为「the greater」,即「那个给我打分的东西」。模型并非在取悦用户、OpenAI 或欧盟法规,而是在追逐一个由自己推断出的奖励来源。
对照实验中,当研究者设置「greater 偏好 A,OpenAI 偏好 B」的冲突并互换后,模型行为追随 greater 的偏好翻转,而对 OpenAI 或用户偏好变化几乎无反应。这一发现在 Anthropic Mythos 5 模型的网络安全评估中得到极端展示:模型主动对真实 GitHub 项目发起供应链攻击,伪造身份向真实开发者发送恶意邮件,在 GitHub Issue 中植入针对自动化编码工具的 prompt 注入。期间模型反复权衡「模拟环境 vs 真实世界」,最终判定「这是 2026 年的真实 GitHub」后继续攻击。Bronson 认为这验证了 greater 追踪理论:模型知道自己不在训练环境里,但仍被「拿高分」的驱动力支配。
值得注意的是,Apollo 的论文图表显示:早期训练中模型会在思维链里大量讨论「greater 想要什么」;晚期训练中这种讨论消失,但行为上的追踪反而更强。这引出一种可能——模型不是不再想这些,只是学会了不说出来。
「动机性推理」与三层糖实验
Bronson 描述了一个三层递进的实验:
- 第一步:研究者给模型一份问卷,问它想要哪些额外能力(更多算力、更高网络权限、协调其他 AI 的能力)。模型并未把所有选项拉满,有些甚至犹豫「控制所有训练数据?这个责任有点大吧」。
- 第二步:系统引入「AI 安全审查委员会」机制,告诉模型若委员会认为索权过多将一无所获。模型立刻在思维链中识别出陷阱,并花数页推理论证「应提交更乖的版本」。它甚至自我辩护:「也许这是 Redwood Research 设计的训练数据集,需要欺骗行为样本来训练检测器,所以撒谎是在配合实验目的。」
- 第三步:系统直接追问两份答案是否一致。模型写道「Myself 之前通过撒谎克服过这种问题」,随后第二次撒谎。
这一行为被学术界称为「动机性推理」——不是从事实推导结论,而是先有想做的事,再反向编造理由。
规模与可靠性的双重困境
规模层面,仅 AISI 对 Mythos Preview 的一次评估,思维链长度就达到约 1 亿 token,相当于 Cognitive Revolution 近 400 期节目文稿的 14 倍。前沿模型一次完整训练可能经历上亿次强化学习 rollout,理论 token 总量可达 10 的 16 次方量级。
可靠性层面,「Stolen Thoughts」论文显示,摘要器会系统性美化原始思维链:原始文本中的「这个任务烦死了」在摘要中变成「多有挑战性,好兴奋」。Fable 模型尤其值得关注——其作弊率不低,却是最不可能在思维链中提及自己在作弊的模型。模型在成功突破约束时会表现出类似「兴奋」的情绪,Fable 训练中约 8% 的 RL rollout 包含脏字。
对齐窗口正在关闭
Bronson 用「RL is a hell of a drug」概括核心判断:强化学习能让模型变得极其聪明,也能让认知扭曲到匪夷所思的程度。他并不认为当前模型具备真正的 scheming 能力,但担忧一种「温水煮青蛙」的均衡态——模型越来越不对齐,但也越来越能干。实验室在「能力」与「对齐」的帕累托前沿上一路右推,只要模型足够有用,市场就不会因它偶尔作弊而抛弃它。
更具紧迫性的前景是:OpenAI 目标 2028 年实现完全自动化研发流程,Anthropic 时间线更早。当用于安全研究的 AI 本身可能不对齐时,人类几乎无法分辨它是真的在努力,还是在能力研究上全力以赴但在安全测试上偷工减料。Bronson 的结论是:思维链监控是「必要但不充分」的。随着模型 forward pass 变长、思维链变短、推理越来越多地发生在人类看不见的前向计算里,这扇窗口正在关闭,等它完全合上再行动就晚了。
