桃子桃子快讯
返回首页
研究论文

大模型多约束遵循研究:5 条以上时能力骤降

研究提出 CSE 基准,对 15 个模型进行 36 万余次规则核验,发现同时遵循 5–6 条以上约束时整体成功率显著塌陷…

2026.08.15 · 周六2 分钟阅读

一项发表于 arXiv 的研究提出「约束饱和评估」(CSE) 基准,对 15 个主流大语言模型在同时满足多条显式约束时的表现进行系统评测。结果显示,模型在单一约束上表现尚可,但当约束数量叠加到 5–6 条以上时,整体遵循能力会出现显著塌陷,最强模型在 7 条约束并存的探测级任务上成功率已跌破 50%。

基准设计与评测规模

研究团队设计的 CSE 基准采用程序化方式生成任务,每条约束由确定性的规则验证器独立评分,全程不依赖 LLM 作为评判,从而避免了由模型自评带来的常见偏差。基准共覆盖 36 种约束类型,并发数量 k 从 1 到 12 变化,总计完成 369,753 次规则核验。这种「零 LLM-judge」的设计使结果具备较强的可复现性,也为后续工作提供了可对照的基线。

三项核心发现

一、组合塌陷而非渐进下滑。 模型对单条约束的通过率随 k 增加呈缓慢、可预测的下降,但「同时满足全部 k 条约束」的概率却急速坍缩。例如在 k=8 时,单条约束通过率约为 41%,而同时通过全部 8 条的概率仅 5.7%。

二、不同约束类型衰减不均。 结构类约束(如推理框架、安全边界、输出 schema)每增加一条额外约束,基线能力损失约为词汇类约束的 2 倍。研究团队将这一差异归结为「理解维持差距」:需要持续追踪状态的约束更易被新约束稀释,而二元决策型约束则相对免疫。

三、失败近似独立,呈乘法累积。 各约束之间的失败几乎独立,这正是整体成功率呈乘法式下降的根源。少数残余耦合主要来自共享输出特征,例如句数错误会同时触发所有读取句数的约束,造成局部「连带失败」。

实际影响与启示

实验揭示,大模型的可靠遵循能力在 5–6 条同时约束处开始失效。在探测级任务(probe-level)上,最强模型在 7 条约束并存时成功率已跌破 50%,而参与评测的 15 个模型中有 12 个在 3 条或更少约束时就低于该门槛。这意味着,在需要同时满足推理格式、安全策略、输出结构等多重要求的复杂 agent 或工具调用场景下,模型的实际可靠性可能远低于其在单一能力测试中所呈现的水平。该基准所揭示的「乘法式塌陷」机制,也为评估多约束代理系统的稳健性提供了量化参考。

信源