研究论文
衡量语言模型智能体的跨任务行为一致性
arXiv 论文提出行为一致性指标(BCM),在约 9000 条轨迹上发现跨任务与单任务一致性是可分离的独立维度。
2026.08.17 · 周一约 2 分钟阅读
近日发表于 arXiv 的一篇论文提出了一种新的语言模型智能体评估指标——行为一致性指标(Behavioral Consistency Metric,BCM),用于量化智能体在不同任务间行为的一致性。当前智能体评估几乎完全依赖结果指标(如成功率),只能反映智能体是否完成任务,无法刻画其行为模式是否稳定。BCM 将"行为一致性"作为独立、可测量的属性来对待,为智能体可靠性提供过程层面的补充信号。
BCM 的核心思路
BCM 的做法分三步:
- 从智能体执行轨迹中提取行为特征,训练一个模型预测任务是否成功;
- 基于该模型,为每条轨迹计算一个特征归因向量;
- 用同一智能体系统内所有轨迹两两之间的平均相似度,作为一致性得分。
这意味着 BCM 不只看"做了什么",而看智能体在不同任务中是否表现出可识别的、稳定的行为模式。
关键实验发现
研究团队在约 9000 条智能体执行轨迹上进行了实验,覆盖 6 个语言模型智能体系统,任务类型为软件工程。其核心发现是:
- 跨任务一致性与单任务一致性是不同维度,且可以分离:部分系统在重复执行同一任务时行为相似(局部可复现),但在不同任务之间缺乏统一策略(全局碎片化);也有系统在两个尺度上都保持一致。
- 一致性不能被成功率替代:成功率相近的智能体,一致性可能差异显著。
- 在控制任务难度不变的前提下,前沿闭源模型与开源模型之间的一致性差距仍然存在。
与现有评估方法的差异
此前的研究通常只度量"同一任务重复执行时的可复现性",因此无法观察到上述局部与全局的分离。BCM 把跨任务一致性显式纳入度量范围,使得智能体的可靠性可以从"过程层面"被独立讨论,而不只是结果层面的成功与否。
适用范围与局限
作者在论文中也明确指出了 BCM 适用的条件与边界,例如其有效性依赖于行为特征的可预测性,以及评估所用任务集的代表性。这一指标更适合作为对结果指标的补充,而非替代。整体而言,BCM 为研究者衡量智能体是否"举一反三地保持稳定行为"提供了一把新尺子。
