Anthropic 让 Claude 自查代码:4 个 Skill 跑完才交付
Claude Code 团队公开内部验证循环,写完代码后会跑 code-review、simplify、verify、d…
Anthropic 的 Claude Code 团队于 7 月 22 日公开了一套内部使用的工作机制——「验证循环」(verification loop)。按照这一机制,Claude 写完代码后不再直接交付,而是会自动跑过 4 道检查:先由 /code-review 揪潜在 bug,再由 /simplify 清理冗余实现,然后由 /verify 做端到端验证;若本次改动涉及界面,还会由 /design 对照 DESIGN.md 核对视觉一致性。4 道检查全部通过后,才算完成交付。
从「会写」到「会自查」
传统智能体闭环是「收集上下文 → 执行动作 → 人工检查」,最后一步压在工程师身上。Anthropic 将这条链路拉长为「收集上下文 → 执行动作 → 自动验证 → 修复 → 再验证」,把检查与修复塞回了循环内。
确定性的信号,例如 type checker、linter、单元测试与运行时报错,Claude 本来就能读取并修复。真正棘手的是另一类「软」检查:界面是否符合设计规范、用户流程是否顺畅、改动是否埋下了后续隐患——这些过去只能靠人反复盯。Anthropic 的解法是:把每次都要手动做的检查逐条写下来,封装为 Skill,交给 Claude 在任务中自动执行。
4 个内部 Skill 的分工
/code-review:审阅代码改动,给出潜在 bug 清单与 review 意见。/simplify:清理本次 diff 中的冗余实现,主动做减法,降低后续维护成本。/verify:将应用真正运行起来做端到端验证,确认功能已实际可用。/design:仅在改动 UI 时触发,对照DESIGN.md核对视觉实现是否跑偏。
这 4 个 Skill 建立在 Claude Code 既有的验证能力之上,包括内置的 /verify、CLAUDE.md 中声明的构建与测试命令,以及在 PR 上做多智能体审查的 Code Review 等。它们相当于在通用地基上又叠加了一道团队自有的工序。
如何写自己的验证 Skill
Anthropic 的建议是:把每次都要手动检查的步骤,用自然语言写下来,就像在向一位新入职同事交代注意事项。写完后,可交给 skill-creator 进一步采访补充,或直接放进 .claude/skills/ 目录下的 Markdown 文件里——一个最简的验证 Skill 就是「几行说明 + 一段正文」。
检查不一定都是「感觉对不对」这类模糊判断。Anthropic 举例:任何删除数据库字段却未配套数据迁移步骤的改动,一律打回。这是一条通用 linter 永远抓不到、却是项目专属的「土规矩」,凡是只能靠人手动死守的红线,都值得被封装进循环。对于内置或插件托管的 Skill,也可以写一个外壳 Skill,让它先调用原 Skill,再追加自定义检查。
四档自动化程度
Skill 封装完毕后,需要决定触发时机。Anthropic 列出了从松到紧的四档:
- Standalone:手动调用,按需触发。
- Embedded:嵌入某个任务流程,随任务一起跑。
- Chained:多个验证 Skill 串联成一个链路,自动按序执行。
- On every PR:每次提交代码都自动跑一次,最严格。
官方把 Standalone 到 Chained 的跃迁称为「从习惯到契约」:原本是「我每次都记得在 /simplify 后补跑一次 /verify」的个人习惯,串成链之后就变成「/simplify 跑完自动触发 /verify」的固定契约。链式验证会显著消耗 token,官方建议先观察稳定性,再逐步提升自动化等级,避免一上来就把所有检查设为 PR gate。
AI 编程的赛道转向
Claude Code 负责人 Boris Cherny 此前也表示,在模型能够长时间自主运行的时代,自我验证是让智能体跑得更久、结果更贴近预期的关键。
值得注意的是,Skill 并非一段 Markdown 提示词,而是一个能力模块,内含指令、文件结构、脚本、工具调用与完整工作流程。更关键的是,Skills 正在从 Claude Code 的特性走向跨厂商开放标准:据业界梳理,GitHub Copilot、Cursor、OpenAI Codex、Gemini CLI 都已经采用同一套格式。这意味着团队沉淀的检查规范、设计要求与踩过的坑,不会被锁定在单一工具内。
Anthropic 的判断是:当 AI 把「写代码」变快变便宜后,瓶颈并未消失,而是转移到了验证、代码评审与安全环节。模型能力的差距正在缩小,真正拉开团队效率差距的,是工作流——有没有把检查写成 Skill、有没有搭起验证循环、有没有让智能体自己把反馈闭环跑通。这篇博客展示的是 AI 辅助开发的流程优化,AI 仍离不开工程师,也无法独立完成生产级交付;但方向已经清楚:从教 AI 写代码,转向教它验证自己写得对不对。
