研究论文
AI 写基准:Codex 自主生成元评测论文
Mollick 让 Codex 递归构建并运行 AI 基准测试项目,最终生成 arXiv 风格论文,称「还挺有意思」。
2026.07.24 · 周五约 2 分钟阅读
Ethan Mollick 在 X 平台分享了一次带有玩笑色彩的实验:他要求 Codex 自主构建并运行一项名为 BenchBench 的基准测试,用于评估「AI 究竟有多擅长创建基准测试」,随后进一步递归生成 benchbenchbench,并按 arXiv 论文的格式撰写成稿。最终输出的 PDF 让 Mollick 直言「实际上还挺有意思的」。
实验思路:从基准到元基准
Mollick 给出的指令呈现出一个清晰的递归结构:
- 第一层:让 AI 创建一个用于衡量 AI 基准创建能力的基准(即 BenchBench);
- 第二层:在 BenchBench 基础上再生成一个「评估 AI 评估 AI 评估能力」的元基准(即 benchbenchbench);
- 第三层:将整个过程写成一篇符合 arXiv 规范的论文。
这种「AI 自我评价其评价能力」的思路,在传统基准评测中较为少见,因此具有一定的概念趣味性。
现有信息与局限
目前可获得的仅为 Mollick 的一条简短推文,文中未披露以下关键细节:
- BenchBench 与 benchbenchbench 的具体评分维度与任务设计;
- Codex 所依托的具体模型版本与参数配置;
- 生成论文的方法论、数据来源与可复现性说明;
- 实验是否经过人工校验或仅为自动生成结果的展示。
因此,该实验目前仍停留在「概念演示」阶段,尚不足以作为方法论创新的正式依据。
行业意义与潜在方向
近年来,AI 基准测试面临「饱和」与「过拟合」两大挑战——大模型在越来越多公开榜单上接近满分,使基准的区分度持续下降。在此背景下,让 AI 参与甚至主导基准的设计与生成,成为一种值得探索的替代思路。Mollick 的实验虽然只是个人随手尝试,但从一个侧面折射出大模型在自动化科研流程上的潜力与边界:它能够生成结构完整的论文文本,但能否产出真正具备学术价值的评测方法,仍有待验证。
