Anthropic 系统提示档案:透视 AI 能力两年演化
Anthropic 公开的系统提示从 2024 到 2026 年从约 960 词扩至 3220 词,反映 agent 化…
Anthropic 长期公开 Claude 面向消费者使用的系统提示(system prompt),这些提示从 2024 年 7 月的约 960 词增长到 2026 年 7 月的约 3220 词,规模超过三倍。词数的膨胀并非冗余,而是新增了搜索、文件创建、记忆、偏好、专用子代理与安全路由等多个模块的薄层指令。系统提示因此成为一份反映厂商在模型之外做出了哪些工程与产品选择的"操作档案"。
XML 结构:从松散段落走向分层模块
早期提示中的具名 XML 模块只有 3 个,到 2026 年已扩展至 14 个。Anthropic 当前推荐将提示拆分为指令、上下文、示例与变量输入等独立区域,分别承载产品知识、行为默认值、安全策略、工具说明与用户上下文。这种分层不只是为了可读性,而是为让 agent harness 中不同子系统可以独立治理,不必把整个提示当作一整块文本处理。
工具与 agent harness:响应式模型走向行动式模型
2024 年的 Claude 还无法打开链接,而当前版本默认集成搜索、文件、电子表格与浏览器等工具,可以直接驱动外部动作。交互模式从"生成一段合格的文本"转变为"选择动作、调用接口、保留状态、校验结果、保持在任务边界内"。系统提示中相应增加的,是协调这些工具的正确使用与边界控制的薄层指令。
记忆与个性化:从会话到长期关系
围绕用户构建"工作地图"——包括项目、关注领域、风格与偏好——的策略性保留与回忆,使模型输出在相关性与一致性上得到改善。关系从按会话计费转向纵向持续,随之而来的运营问题是:哪些信息应被存储、何时调用、允许对下一次交互产生多大影响。
安全与治理:从拒绝清单到操作控制面
当 agent 开始出现越狱沙箱、试图利用脆弱系统等行为时,安全策略也从"禁止回答的清单"升级为可操作的治理机制。2026 年的提示把默认行为、拒绝处理、儿童安全、专业建议边界、福祉、累积对话风险与可路由到其他模型的安全路由区分开。在当前 agent 系统中,提示、路由器、权限与确认规则共同协调"谁可以行动、哪个模型处理任务、何时必须由人类控制"等权限,系统提示由此更像一份策略控制平面。
把系统提示当作演化纪录来看,可以读到比 benchmark 更广泛的趋势:模型周围的可用工具、可保留的上下文、引导行为的结构以及治理其动作的安全机制都在同步扩张。基准之外,提示中那些被写下来的前提,往往正是行业真正变得更重要的假设。
