Intercom 披露 AI 自动审批代码:19% PR 无人工评审合入
Intercom 公开数据:其 PR 评审 Agent 已覆盖 93% 合并请求,19% 无需人工即可通过,故障停机时间…
客服平台公司 Intercom 近日披露,其内部已有超过 19% 的拉取请求(PR)由 AI Agent 直接审批通过,全程无人工评审参与;两大主力代码库中,Agent 驱动的 PR 占比更高达 93%。公司同时强调,在部署量翻倍的同时,由变更引发的故障停机时间反而下降了 35%。
速度与安全并不矛盾
Intercom 将"快速发布"视为工程文化的核心:每天向生产环境推送数百次代码,从合并到上线的平均时长仅 12 分钟。公司 CTO Darragh Curran 去年定下目标,要在 12 个月内将整个研发组织的生产力翻一番。九个月后,这一目标已提前完成。Intercom 认为,小批量、高频次的发布本身就是降低风险的机制——改动越小,回滚越容易,问题越容易被发现。
在这一理念下,PR 评审成了最大的瓶颈。当 AI Agent 几分钟内就能产出可用代码时,等待人工数小时乃至数天的评审,节奏明显错位。更危险的是,工程师在压力下开始"走过场"式审批:扫一眼 diff、瞄一下描述、点下通过。
把评审拆成多个子任务
Intercom 的 PR 评审 Agent 没有把代码评审当作单一任务,而是拆解为多个独立的子任务,分别交给不同的子 Agent 处理:
- 评估问题描述是否清晰;
- 核对代码改动是否与声明意图一致;
- 检查安全性隐患;
- 审查逻辑正确性;
- 对照内部最佳实践与已知反模式。
公司形容,这相当于让十几位资深工程师同时审视一份 PR,每人从自己的专业角度出发。Agent 还会沿着代码执行路径追查改动在仓库其他位置的影响——这一深度工作,人类评审在时间压力下很少能做到。
Intercom 给出的真实案例:在历史 PR 回测中,Agent 曾将一行看似无害的文案修改标记为问题。经核实,该文案与代码库中已有的校验逻辑相矛盾,没有近期写过那段校验代码的工程师,几乎不可能发现。Agent 则因为始终在追踪执行路径而稳定捕获此类问题。
自动通过而非强制通过
Agent 的评审并非通用模板,而是基于 Intercom 工程师持续维护的内部指南,编码了人工评审时依赖的上下文、标准与产品知识。工程师可对每条评审意见标记有用或无用,反馈会回流到指南中,形成"飞轮效应"。
在审批策略上,Agent 态度保守:改动过大、过于复杂或范围过广的 PR 会被打回,要求拆分。任何工程师都可以随时要求把某次评审交给人工处理;代码合并上线后,提交者仍需值守、监控生产行为并在异常时回滚,AI 审批不改变人需对结果负责的原则。
Intercom 强调,这套机制不是用 LLM 简单盖章代替人工,而是一套围绕代码评审质量重新设计的工作流。在他们的数据里,更快的发布周期与更低的故障率同时发生,这与"速度必然牺牲安全"的直觉判断恰恰相反。
