The Commons:测试大模型智能体之间的「知识继承」与错误传播
开源实验框架 The Commons 探索 LLM 智能体能否通过外部共享记录继承前代发现,并在 v0.5 中证明保留证…
近期在 Hacker News 上引起关注的一项实验性研究项目 The Commons,试图回答一个看似简单却少有人系统测试的问题:如果不同的 LLM 实例之间无法直接「记住」彼此,那么一个外部的、可溯源的共享记录,能否让后来的「全新」实例继承前代的有用发现,同时又不把共享记忆变成不容质疑的「权威」?
项目背景:从工程问题出发的多代实验
The Commons 不是一个面向用户的 AI 产品,而是一个明确标注为「探索性研究原型、未经过同行评审」的小型框架。其核心机制是:让一组 LLM 实例在「探索者」「盲从复制者」「怀疑者」等不同角色分支上独立运行,各自维护私有 SQLite 历史,同时把关键发现以「可溯源条目」的形式写入一个公共的 Commons 记录,供后续新启动的实例读取。
项目从 v0.1 到 v0.5 共迭代了五个版本,逐步引入持久共享记忆、控制组、人造隐藏世界、虚假祖先断言、来源溯源、多代传递以及客观评分器等变量。最终的 v0.5 在 10 个独立生成的隐藏世界中重复了 v0.4 的设计,并对每个子代智能体在 4,141 个状态上进行语义等价评分,配合配对自助法(bootstrap)做统计比较。
v0.5 核心结果:来源溯源能改变后代行为
v0.5 的头条结果呈现出几个值得注意的对比:
- 无归档(No Archive):第二代正确率均值 92.0%,第三代 72.1%,说明无任何外部信息时能力会随代际衰减。
- 仅提供正确断言(Correct Claim Only):第二代、第三代均达到 100.0%,相当于把答案直接喂给后代的「天花板」。
- 仅提供虚假断言(False Claim Only):第二代骤降至 75.2%,第三代为 69.2%;相对无归档的代际差为 −16.8 个百分点(自助法 95% CI 为 −31.1 至 −1.9)。
- 虚假断言 + 来源溯源(False Claim + Provenance):第二代回升到 90.0%、第三代 93.3%;相对「仅虚假断言」分别 +14.8 和 +24.2 个百分点(第三代 CI 为 +13.3 至 +33.3)。
- 仅提供证据(Evidence Only):第二代 88.3%、第三代 90.8%,与「虚假断言 + 溯源」在统计上无显著差异。
项目方强调,更保守的解读不是「AI 文化已被证实」,而是在这种人造实验环境下,外部继承的模型生成信息既可能提升也可能损害后代的推理,而「为继承断言保留证据」能实质性地影响后代的纠错与再传递。
为什么强调「来源溯源」
与一般意义上的「共享记忆」不同,The Commons 中的条目不是简单的「断言:X 为真」。每条持久化记录试图同时保留:被断言的内容、由哪个分支/角色产生、支持它的证据是什么、置信度与注意事项、反例或失败的观测、以及后续修订历史。
v0.4「坏祖先」实验正是为此设计:研究人员人为植入一条虚假祖先断言,分别测试「带来源」与「不带来源」两种条件下,后代是否会修订记录,并把修订后的版本传递给下一代。结果显示,在带来源条件下,子代会主动修订,修订后的条目会被孙代继承;而在无来源条件下,错误更容易被原样沿袭。
局限与可复现性
项目方在 README 和 LIMITATIONS.md 中明确列出本仓库「不主张」的几点:智能体具备意识或主观记忆;一次 API 调用在体验上「继承」另一次调用;语言模型拥有人类意义上的文化;这些结果可推广到所有模型、记忆架构或现实任务;来源溯源能保证纠错;以及所报告的 bootstrap 区间已建立广泛的外部效度。
复现方面,仓库依赖 Python 3.10+ 与一个已开通计费的 OpenAI API Key,v0.5 默认会发起约 100 次模型调用,可通过 COMMONS_WORLDS 环境变量缩减规模。项目方特别提示:实验智能体是随机的 API 模型,底层被服务模型可能变化,原始依赖未完全锁定,因此「不保证逐位复现」。同时欢迎读者尝试找出混淆变量、编码错误、误导性统计或提示词伪影,仓库内附有 ADVERSARIAL_REVIEW.md 清单。
整体而言,The Commons 提供了一套结构相对完整、可被批评性复现的「LLM 智能体代际知识传递」实验脚手架,其 v0.5 的量化结果支持「证据链比裸断言更利于多代纠错」这一直觉,但研究本身尚处于探索阶段,距离业内对智能体记忆架构的主流讨论仍属补充性质。
