研究论文
arXiv 新论文:用博弈论优化多智能体 LLM 的路由与通信成本
提出面向多智能体大模型系统的合作博弈框架,以边际价值与 Shapley 值进行动态路由与通信定价,合成实验优于全广播。
2026.08.11 · 周二约 3 分钟阅读
arXiv 上的一篇新论文提出了一种面向多智能体大模型系统的动态联盟与通信定价框架,旨在解决 agentic AI 系统中固定通信结构或全广播带来的 token 成本、延迟与冗余问题。作者将智能体选择与通信建模为任务条件下的合作博弈,并通过理论分析与合成实验验证其有效性。
核心框架:任务条件下的净效用模型
论文将多智能体协作形式化为任务条件下的净效用函数 U(C|x) = V(C|x) − Σ c_i,其中 C 为激活的智能体集合,V(C|x) 为任务 x 下的联盟价值,c_i 为各智能体激活成本。作者据此提出:
- 边际价值激活规则:以每加入一个智能体带来的效用增量作为判据;
- 贪心路由器:在执行前按边际价值选择需要激活的智能体;
- 通信边优化:进一步将模型扩展至带边成本的情形,仅保留高价值的通信连接;
- Shapley 值预测:在执行前与执行中估计每位智能体的贡献,用于预测哪些 agent 「值得联系」。
理论结果:两类近似保证
论文将上述问题与子模最大化的经典结论相联系,给出两组有限保证:
- 基数约束、单调情形:将梯度项纳入分析,得到一个由曲率(curvature)细化的近似界;
- 无约束、非单调情形:通过 double greedy 算法给出紧的 1/2 近似,并对带符号目标给出修正。
作者也明确指出:上述两项保证并不直接适用于主路由器,主路由器仍为启发式方法。此外,论文证明了一个 Shapley–子模夹逼界,将边际价值路由的误差与单调递减的逐智能体贡献量联系起来。
实验表现:合成环境下的高效路由
在合成实验设置中,论文报告了三组关键数据:
- 贪心路由获得的效用达到暴力搜索最优的 99.5%,平均仅激活 8 个候选智能体中的 1.96 个;
- 作为对照,全广播策略仅获得最优效用的 38.8%;
- 在弱化子模性假设或价值估计受噪声干扰的强设定下,性能回落至 66%。
实验还表明,方法对激活成本与冗余权重具有较好的鲁棒性,但在子模性被严重违反或价值估计噪声较大时退化明显。
与相关工作的区分及后续方向
论文在最后一节将自身框架与 Shapley 定价、享乐联盟形成(hedonic coalition formation)以及通信图剪枝(communication-graph pruning)等方向做了区分,强调其侧重点在于任务条件下的智能体激活与通信边决策的联合优化。论文尚未在真实多智能体 LLM 基准上评估,作者将这部分列为未来工作。
