桃子桃子快讯
返回首页
行业动态

实测警示:AI 评审-修复循环未必收敛

作者通过让 Opus 5 历经三轮评审-修复循环,发现缺陷数量不降反升,提醒开发者勿盲信 AI 自动闭环。

2026.08.26 · 周三2 分钟阅读

在 AI 辅助开发日益普及的当下,「让 AI 评审代码、再由 AI 修复」的工作流被不少人视为通往高质量代码的捷径。然而一篇发表于 Hacker News 的实测文章指出:这种循环若不加引导,往往并不能收敛,反而可能越改越乱。作者以 Claude Opus 5 为对象进行了一次小型实验:先让模型生成一小段「完美的、非平凡」代码,再连续执行三轮「评审-修复」循环。结果显示,随着循环次数增加,代码中的缺陷数量不降反升。

模型判断不一致,循环难以收敛

文章首先指出,AI 在不同运行之间缺乏稳定一致的判断标准。今天它认为「好」的代码风格,明天可能给出相反评价;最坏情况下,同一轮评审就会出现反复自我否定,形成永无止境的来回。这种不确定性使得简单的「评审-修复」闭环很难真正收敛到一个稳定的代码状态。

评审容易诱发范围蔓延

其次,AI 评审倾向于不断扩张关注点:从「这里缺一个单元测试」,到「这里缺一套 CI/CD 流程」,再到「是不是应该再做一个 Android 客户端」。在没有人工约束的情况下,这些建议会推动 PR 越改越大,最终偏离原本的修改目标。

幻觉与误报会引入新缺陷

更值得警惕的是,任何 AI 评审中的假阳性或幻觉——例如错误地指出某段逻辑有问题、或者「修复」时引入新的语义偏差——都会让代码偏离原本的正确状态。在反复循环中,这些小偏差会被不断叠加与放大。

实测:三轮循环后缺陷增加

作者在文末附上了完整的 AI 生成实验报告:在 Opus 5 上执行的三轮评审-修复循环中,缺陷数量随循环次数单调上升,与「越审越好」的直觉相悖。这一结果并非严格的科学实验,但对于日常使用 AI 辅助开发的工程师而言,是一个值得参考的提醒:AI 评审并非免检印章,必要的边界与人工把关仍是不可或缺的环节。

信源