桃子桃子快讯
←返回首页
研究论文

AI 开发范式转向「复合系统」,单一模型时代渐退

研究者提出「复合 AI 系统」概念,认为在多组件配合下取得的最优成绩正逐渐取代单纯放大模型的路线。

2026.09.26 · 周六约 4 分钟阅读

2023 年,大语言模型(LLM)凭借一句自然语言指令就能完成翻译、编程等通用任务,迅速成为 AI 应用开发的核心。但研究者指出,这一局面正在改变:当前最前沿的 AI 成果越来越多地来自多组件协同的复合 AI 系统,而非单一巨型模型。围绕这一趋势,研究团队系统分析了背后动因,并讨论了它对开发者意味着什么。

什么是复合 AI 系统

复合 AI 系统指由多个相互协作的组件共同完成任务的人工智能系统,这些组件可以包括对模型的多次调用、检索器、外部工具等。它与传统意义上的 AI 模型(即一个统计模型,例如预测下一个 token 的 Transformer)形成对比。研究者认为,复合系统将是未来最大化 AI 效果的主流路径,也可能是 2024 年 AI 领域最重要的趋势之一。

工业界与学术界的多重证据

越来越多顶尖成果来自复合系统,而非单次模型调用:

  • AlphaCode 2:通过精心设计的系统,让 LLM 为同一编程任务生成近 100 万种候选方案,再筛选过滤,在编程竞赛上达到当时最优水平。
  • AlphaGeometry:将 LLM 与传统符号求解器结合,用于解奥数几何题。
  • 企业落地:Databricks 内部统计显示,60% 的 LLM 应用采用了某种形式的检索增强生成(RAG),30% 使用了多步链式调用。
  • 推理策略升级:微软在医疗考试题上使用链式策略,将准确率在 GPT-4 的基础上再提升 9%;谷歌在 Gemini 发布文中采用了 CoT@32 推理策略——对同一问题调用模型 32 次——以测量 MMLU 基准成绩,引发了关于如何与单次 GPT-4 调用公平对比的讨论。

这些案例共同表明:通过精巧的系统工程,往往比单纯扩大训练规模能更快、更便宜地拿到更高的成绩。

为什么开发者选择复合系统

研究团队总结出四点主要原因:

  • 系统设计的天花板更高、迭代更快。 模型训练带来的边际收益递减,而系统迭代周期更短。例如,将当前最佳 LLM 在编程竞赛题上的通过率从 30% 提升到 35%,需要把训练预算翻三倍;但用采样—测试—筛选的系统设计,今天的模型就能把通过率提升到 80%,正如 AlphaCode 所示。
  • 系统天然支持动态信息。 模型的「知识」被训练数据冻结,要接入实时数据就必须借助检索、搜索等外部组件。权限控制同样如此——要让 AI 只回答用户有权访问的文件内容,必须在模型外构建系统逻辑。
  • 可控性与可信任度更易实现。 单一神经网络难以保证行为边界,而系统级过滤、引用来源、自动事实校验等机制可以显著降低幻觉、增强用户信任。
  • 性能—成本曲线需要灵活调节。 不同应用对质量、延迟、成本的容忍度差异巨大:GitHub Copilot 类行内补全需要小模型加启发式搜索,而法律咨询场景中,用户愿意为更高准确率支付更多,这就要求系统能在更大预算下调用更多资源。

与其他 AI 领域的趋势一致

这一范式并非生成式 AI 独有。在自动驾驶等传统 AI 领域,最先进的实现也通常是多个专业组件协同工作的系统——这进一步说明,复合设计是 AI 工程化落地的普遍路径。

前景与开放问题

复合 AI 系统的兴起,带来了与单纯训练模型截然不同的设计问题:如何编排多个组件、如何优化端到端质量、如何评估与监控。与此同时,用于构建和优化复合系统的工具,远不及模型训练本身受到的关注与投入,仍是一片有待开发的工程与研究空间。研究者认为,能巧妙运用系统工程的团队,将持续获得超越「更大模型」的竞争优势。

信源