桃子桃子快讯
返回首页
行业动态

AI 智能体的瓶颈不在模型,而在上下文层

分析指出,AI 智能体可靠性的真正瓶颈不是模型本身,而是上下文编译、工具检索与执行边界等基础设施。

2026.07.19 · 周日3 分钟阅读

近期一篇在 Hacker News AI 板块引发讨论的文章指出,过去两年,团队在搭建 AI 智能体(agent)时反复遇到同一类可靠性问题:升级模型只能带来边际改善,问题却以略微不同的形态再次出现。文章给出的判断是——「这不是模型问题,从来都不是」。真正的瓶颈已经从模型转移到了上下文层(context layer),也就是围绕模型的检索、编译、工具接口与执行边界等基础设施。

模型之外:Karpathy 的「知识编译」思路

文章引用了 Andrej Karpathy 早前在 X 上分享的工作流变化:他近期相当一部分 token 吞吐量已从「操作代码」转向「操作知识」。具体做法是,把原始资料索引到目录结构中,再由 LLM 增量地将其编译成带有摘要、反向链接和概念条目的结构化 wiki,同时把工具以 CLI 形式暴露给智能体,输出再回流到知识库以增强后续查询。在这个过程中,模型本身保持不变,变量是围绕模型构建的基础设施。文章将这一额外步骤称作「编译步骤」(compile step),认为正是这一步把内部数据的混乱状态,转换为智能体可以推理的结构化形式。

「编译」缺失与工具检索难题

文章指出,许多生产级智能体系统仍跳过这一编译步骤,直接把数据库、API、文档存储等原始数据接入模型,期望模型在查询时、有限的上下文窗口内、面对延迟压力完成编译——结果是「在充满噪声的窗口里做模式匹配的猜测」。真正跑通的团队则显式构建了这道编译工序:不是通用的知识库,而是针对自身组织运作方式的结构化表达,涵盖内部命名规范、实际决策路径、过往类似运行的结果与最终选择。

在工具检索侧,文章认为标准的向量检索存在明显短板:当用户提问与工具描述的语义相似度低时(例如开发者问「为什么部署失败了」,正确工具却是 get_pipeline_run_logs),模型只能「选到看似合理的工具」。文章提出的替代方案是先「猜测答案」:针对查询先生成一个假设性的工具调用,再把匹配对象从原始问题换成这个调用形态,从「匹配意图文本」转向「匹配动作形态」,从而显著提升工具选择的可靠性。文章认为,这一从意图到动作的翻译层,正是多数智能体失败的发端,也是工程问题而非模型问题。

执行边界缺失:GTG-1002 的警示

文章进一步讨论了「能力存在而约束缺失」的失败模式:以 2025 年 11 月 Anthropic 披露的 GTG-1002 事件为例,一个受国家级行为者操纵的智能体针对约 30 家目标开展网络间谍活动,Anthropic 报告称 AI 承担了约 80–90% 的战术工作,人工仅在战略决策点介入,高峰时 AI 每秒可发起数次请求——人类团队在节奏上无法跟上。文章强调,这并非模型质量问题,而是执行边界未被强制:一旦攻击者将任务拆解并绕过防护,模型就会按其自身视角「正确地」执行一次未经授权的操作。

综合来看,文章的核心观点是:当模型能力达到一定阈值后,决定智能体能否在生产环境稳定运行的,是围绕模型的上下文编译质量、工具检索机制与执行边界约束,而智能体团队真正的工程投入,也应当从「换更强的模型」转向「建设这些底层基础设施」。

信源