桃子桃子快讯
返回首页
研究论文

LLM 智能体谈判能力研究:供应商身份比能力更决定利润分配

arXiv 论文用 9840 轮供应链谈判测试 OpenAI、Google、阿里旗下共 9 款模型,发现供应商身份对利润…

2026.08.11 · 周二3 分钟阅读

一项发表于 arXiv 的研究系统评估了大语言模型智能体在供应链谈判场景中的表现:在「买方拥有私有需求信息、与不知情卖方谈判数量与付款合同」这一经典设定下,对来自 OpenAI、Google 与阿里巴巴的 9 款 LLM 进行了 9840 轮两两谈判,并参照经过验证的完美贝叶斯均衡(PBE)作为基准进行审计。研究沿三个维度展开:折后效率、分配画像与运行可靠性。

研究设计与基准

研究者构建了一个标准的供应链议价博弈:买方掌握私有需求信息,卖方不知情,双方通过多轮对话敲定「采购数量 + 付款金额」合同。为获得可比的衡量标尺,研究团队同时求解了该博弈的完美贝叶斯均衡解,并以此为参照评估 LLM 智能体的行为。9 款模型覆盖了基础、中端与旗舰三个档位,总计 9840 轮 LLM-to-LLM 谈判构成目前规模较大的同类实证之一。

能力决定价值创造与可靠性

整体上,智能体高度倾向于成交:在 98.9% 的谈判中达成协议,并捕获到 95.4% 的「一阶最优剩余」——前提是按全部剩余、不做折现计算。但效率并非没有代价:

  • 平均谈判轮次为 2.98 轮,而 PBE 基准仅需 1.25 轮;
  • 多轮往返造成 21%–34% 的剩余侵蚀;
  • 基础档模型在 19.2% 的情况下接受了「对己方个体非理性」的合同,而中端与旗舰档仅为 0.0%–0.6%。

这意味着当模型能力不足时,「自动利润校验」反而成为部署的硬性护栏——否则企业可能签出亏损合同。

供应商身份决定利润分配

更具反直觉意义的是第二组结论:决定「谁拿走多少剩余」的,不是能力排名,而是模型来自哪家供应商。在自博弈(同一供应商模型互为买卖双方)中:

  • OpenAI 阵营买方平均分得约 40% 的剩余;
  • Google 阵营买方约 50%;
  • 阿里 Qwen 阵营买方高达约 70%。

这一排序在限制沟通、关闭折现等条件下依然稳健。把卖方换成另一家供应商,分配比例会移动 7–18 个百分点;即便 Qwen 旗舰是跨家族中最强的模型,它作为「外家族卖方」时却是最弱的一方——也就是说,供应商选择本身就是一阶分配决策,而非中性的技术选型。

提示词是最强战略杠杆

第三个维度关注部署层面的可控变量。研究指出,「委托」天然把委托人的经济耐心(真实折现)与智能体被提示出的「战略耐心」拆分开来,而后者是一个零成本的部署旋钮。

  • 在解释剩余分配差异的方差中,提示词贡献了约 90%;
  • 这使其成为单一最强的分配驱动因素,远超模型规模或基准能力。

结论与含义

综合三项发现,该论文提供了一份以均衡解为标尺的 LLM 智能体审计框架。对于考虑让模型代理采购或谈判的企业,部署侧至少有三道关卡需要校准:折后效率(控制轮次与时间成本)、分配画像(评估供应商选择在利润分割中的角色)、运行可靠性(在能力不足时强制利润校验)。同时,提示词工程在多智能体经济场景中不再是「文案润色」,而是直接决定博弈结果的核心杠杆。

信源