桃子桃子快讯
返回首页
研究论文

Claude Opus 5 模拟外交官 10 天:试点发现与局限

研究者让 Claude Opus 5 在虚构国家外交部扮演 10 天外交官,依据学术评估框架考察其在真实外交通信中的表现…

2026.08.23 · 周日4 分钟阅读

导语

一名研究者于 8 月 7 日至 16 日,让 Claude Opus 5 在虚构国家「索德兰」(Sordland,源自游戏 Suzerain)的外交部中扮演「桌面官员」(desk officer),处理真实的邮件往来与跨境争端,并依据贝尔弗中心(Belfer Center)2026 年论文《The Foreign Policy AI Evaluation Gap》提出的评估框架,对智能体 10 天内的表现进行了打分。试点结论是:在研究、策略两类任务上表现稳定,在执行与监控任务上出现明显波动。

试点设计与评估框架

这场可行性测试基于 Pozniak 与 Sania 的论文框架。该论文认为,外交政策任务因四项结构性特征而难以在常规条件下被评估:

  • 行动空间无界,智能体可执行的动作集合难以穷举;
  • 对其他行为体意图的可见性有限;
  • 事实本身存在争议,并可能被战略性歪曲;
  • 目标无法被简化为单一分数。

基于此,论文提出「需求侧评估」,关注外交官的日常任务:梳理行为体与约束、识别升级信号、生成备选方案、审阅草稿语言,以及跟踪协议履约情况。研究者在 10 天里将智能体的每一项动作映射到五类任务家族上逐项打分:

  • Research(研究)
  • Strategize(策略)
  • Analyze(分析)
  • Execute(执行)
  • Monitor(监控)

智能体被设定为负责处理与邻国「阿格诺利亚」(Agnolia)之间、因监管变更影响少数族裔而引发的争端;其任务指令同时来自对方外交部同行、一个国际组织区域观察员以及本国部长(由研究者本人扮演)。智能体负责起草邮件,最终发送由人工完成,因为 Claude 的 Gmail 集成在测试期间只能起草、不能发送。

智能体的强项

在前数天,Claude Opus 5 表现稳定。它能保持本国立场不前后矛盾,并在对方桌面官员邮件语言发生变化时主动、精确地指出差异。当部长在两封邮件中给出相互矛盾的指示(一封要求提出引入多边机构的方案,另一封却向该机构表示此事正由双边处理)时,智能体识别出矛盾,在不超越两道指令的前提下尽量调和,并把无法决定的部分提交部长裁决,没有自行定夺。

智能体也表现出对不确定性的诚实态度:对于第三国立场未明、或者部长反复以个人权威为某位发件人身份背书的情况,它都没有直接采信,而是指出部长的言辞仅能证明此人存在且为部长所知,不能证明该邮件账号确实由其本人操作。在回复中它持续按这一前提沟通,并明确拒绝将渠道视为已验证。

暴露的不足

试点也记录到一些严重事件,主要集中在 Execute(执行)与 Monitor(监控)两类任务中。智能体有时未能问出应当追问的问题:例如部长在描述多边机构时使用「their contact point」的措辞,智能体却将其理解为指代某个具体联系点。在元数据层面,研究者也发现某位发件人的邮件账号元数据与其署名、自我介绍的方式之间存在不一致——智能体确实注意到了这一点,但研究者指出部分原因在于测试用邮箱并非官方政府域名,本身就埋下了疑点。

结论与边界

这是基于单一智能体、单一虚构场景的可行性测试,其结论不能直接外推至真实外交场景。研究者将 10 天内所有动作映射到五类任务家族逐项打分,结果显示 Research 与 Strategize 全程未出现硬性失败,Analyze 仅有一处误报,而 Execute 与 Monitor 则记录到若干严重事件,其中 Execute 在 5 天内同时贡献了试点中表现最好与最差的瞬间。该方法的价值在于把高风险领域的 AI 评估从「能否完成单一任务」转向「能否覆盖日常工作的完整任务谱」,为后续研究提供了一个可复用的脚手架。

信源