AI 辅助代码破坏主干概率仅为人工一半
Mergify 基于 20 万次合并数据发现,AI 辅助的 PR 破坏主干的概率约为人工代码的一半,但团队规模越大主干越…
合并队列(merge queue)服务商 Mergify 发布《State of Merge Queues 2026》报告,基于其平台上过去三个月发生的逾 20 万次合并、覆盖 477 个工程团队的数据,分析了「PR 被批准」到「合入主干」之间那段常被忽视的环节。报告最引人注目的发现是:AI 辅助编写的 PR 破坏主干的概率,约为非 AI PR 的一半(1.9% 对 4.4%),即便在控制 PR 规模和仓库差异后,这一结论仍然成立。
AI 代码反而更安全
报告统计了超过 10 万次合并,发现 AI 辅助 PR 的主干破坏率为 1.9%,而非 AI PR 为 4.4%。报告作者、Mergify 联合创始人 Julien Danjou 指出,这与「AI 制造大量隐蔽坏代码」的普遍担忧相反。AI 辅助的痕迹在私有仓库合并中已经占到约七分之一,考虑到多数 AI 工具并不会在 PR 中留下可识别信号,实际占比只会更高。
团队规模才是主干风险的主因
真正放大风险的变量是团队规模,而非是否使用 AI:
- 2–5 名工程师:主干破坏率约 0.77%,即 130 次合并中约 1 次。
- 6–15 名工程师:约 0.98%。
- 16–40 名工程师:升至 2.49%。
- 40 名以上:高达 12.5%,即每 8 次合并就约有一次破坏主干。
报告指出,私有仓库的整体破坏率(5.1%)约为开源仓库(1.1%)的 4.5 倍,原因在于私有代码的内部依赖更密集。失败的合并批次平均捆绑了约 6 个 PR,一个坏改动可能拖累其后 5 个本无问题的 PR。
队列并不慢,但极少人用批量合并
报告还澄清了一个常见误解:合并队列并不会显著拖慢流程。中位数 PR 在队列中停留约 7 分钟,90% 的 PR 在一小时内完成。真正的瓶颈在于是否启用批量测试——私有仓库中仅约 6% 的合并采用了批量方式,开源仓库更低至约 2.7%;而批量合并能将多个 PR 放入同一次 CI 运行一并验证,是降低 CI 成本的主要杠杆。
依赖 Dependabot、Renovate 等自动化的 PR 平均仅需约 0.4 分钟出队列,而人工 PR 平均约 12 分钟,报告将二者数据分开统计以避免机器人「美化」人类指标。
方法与局限
上述细分基准基于「至少 10 次合并、2 名以上人类作者」的过滤样本,约 160 个团队、15.3 万次合并,且完全匿名化处理。开源与私有的划分基于仓库的对外可见性,而非代码本身属性。报告同时承认,AI 使用痕迹依赖 PR 中可被识别的信号,绝大多数 AI 工具不会留下此类痕迹,因此 AI 辅助的实际占比被低估。
数据来源单一来自 Mergify 自家平台的客户群体,是否能代表更广泛的工程团队仍有待外部验证;但作为目前公开的、最大规模的合并队列实证数据之一,其结论对评估 AI 编程工具的真实影响、以及为成长型团队规划合并策略,仍具有参考价值。
