ARA 取代 PDF?研究者呼吁论文为 AI Agent 而生
斯坦福、MIT 等 37 位研究者提出 ARA 协议,将科研论文重构为 AI 可直接操作的知识包,测试显示其理解准确率达…
来自斯坦福、密歇根、卡内基梅隆和 MIT 等机构的 37 位研究者联名发表论文,呼吁用一种面向 AI Agent 的科研论文格式——ARA(Agent-Native Research Artifact)取代统治学界数十年的 PDF。论文题为《The Last Human-Written Paper: Agent-Native Research Artifacts》,第一作者是密歇根大学计算机科学博士生刘嘉晨。她提出,当 AI「榨干」了人类专家的数据后,科研知识的共享方式也必须随之改变:AI 的需求应被置于首位。
为什么 PDF「该死」
研究团队认为,PDF 在两件事上有根本缺陷:
- 「叙事税」:真实的科研从来不是从问题直通答案的直线,研究者通常要提出十几个假设、尝试几十种方案、经历大量失败。但论文最终呈现时,那棵枝杈横生的探索树会被修剪成一条干净、连贯的成功路径,大量失败过程被主动舍弃。
- 「工程税」:一篇论文只要能让审稿人信服就算完成使命,但「说服审稿人」与「让 AI 完整复现」是两套标准。团队统计了 PaperBench 中的 8921 项专家复现要求,发现仅 45.4% 在论文 PDF 中得到了完整说明。模型版本、超参数、预处理方式等决定成败的细节,往往散落在正文、附录与代码仓库中,有些甚至从未记录。
ARA 的四个层次
ARA 不再将线性叙事的论文视为科研成果本身,而是把研究重组为一个机器可直接操作的知识包,包含四个层次:
- 科学逻辑层:记录研究解决的问题、采用的方法以及哪些主张可被证伪。
- 可执行代码层:不仅提供代码仓库,还包含复现实验所需的环境、配置与关键参数。
- 探索图层:将实验过程还原为可追踪的路线图,成功与失败方向、放弃某条路线的原因均被保留。
- 证据层:将论文中的每一项主张关联至原始实验结果,方便 AI 核验结论,而非仅采信正文中的概括性描述。
概括来说,PDF 呈现的是「我们最后做成了什么」;ARA 展现的还有「为什么这么做」「具体怎么做」「哪些方法已失败」以及「原始证据在哪里」,追求「知识优于叙事」。
实测:ARA 是否真的更好用
研究团队从理解、复现、延伸三个维度对 ARA 进行了系统测试。
- 理解测试:设置 450 个问题,ARA 组的 AI 准确率达 93.7%,传统 PDF + 代码仓库组仅 72.4%,相差 21.3 个百分点。其中「复盘失败」一项差距最大——ARA 组 81.4%,传统组仅 15.7%。
- 复现测试:选取 15 篇附带 GitHub 仓库的机器学习论文,设置 150 项复现任务。ARA 组的难度加权成功率为 64.4%,传统组为 57.4%。在简单、中等、困难三档任务中,ARA 分别领先 4.9、5.6 和 8.5 个百分点,任务越难优势越明显。
- 延伸测试:在最具挑战性的 RE-Bench 开放任务中,ARA 组赢下 3 项,传统论文组赢下 2 项。团队进一步分析 24008 次 AI Agent 运行发现,90.2% 的资金成本都消耗在失败探索上,而传统论文几乎不保存这些失败记录。
ARA 也并非完美
尽管成绩单亮眼,研究者坦承 ARA 距离「PDF 终结者」还有相当距离:
- 覆盖范围有限:目前实验只覆盖天然适合代码复现的机器学习领域,能否用于湿实验或理论学科尚待验证。
- 隐私与安全:尚未实现细粒度访问控制,缺少沙箱执行与内容异常检测,存在数据泄露风险。
- AI 幻觉与路径依赖:在 15 篇论文的复现实验中,传统组出现 2 次结果编造,ARA 组也出现 1 次,AI 既可能捏造结果,也可能过度采信前人判断。
研究者背景
ARA 研究由斯坦福大学、密歇根大学、卡内基梅隆大学和 MIT 等机构共 37 名研究者共同完成。第一作者刘嘉晨是密歇根大学计算机科学博士,深耕机器学习系统与大模型基础设施领域,曾在 Meta 从事大模型预训练与后训练基础设施相关工作,并于 2023 年入选 Machine Learning and Systems Rising Stars 荣誉榜单。今年 5 月,她在帕洛阿尔托创立 Agent-Native Research Lab,并联动产学研推动 ARA Commons 科研生态建设,目前其公开成果包括 ARA 协议及论文、配套代码以及面向 NeurIPS 2026 的 AI 驱动科研生态研讨会。
值得一提的是,这篇呼吁取代 PDF 的论文本身,仍然是以 PDF 格式提交和呈现的。
