桃子桃子快讯
←返回首页
研究论文

JEV-Star:用语言模型低成本控制星际争霸 II

JEV-Star 通过 LLM 规划 + 实时执行,在星际争霸 II 宏观对战中实现 9/10 胜率,并在 SMAC-H…

2026.09.25 · 周五约 4 分钟阅读

JEV-Star 是一个把大语言模型(LLM)规划与实时执行结合,用于控制《星际争霸 II》对战的开源项目。它由两部分组成:宏观(Macro)模块负责整局运营,微观(Micro)模块在 SMAC-Hard 的 35 张地图上做单位微操。研究团队通过 LLM Play SC2 / BurnySC2 接口,把结构化的游戏状态交给 LLM 规划器(Astra),再由 JEV 选择动作,最终交给本地执行器在实时帧上推进游戏。

宏观对战:五种配置对比

宏观模块基于 Protoss,定义了 73 个动作空间,采用 20 分钟游戏时长、Altitude LE 等 6 张天梯地图进行测试。研究者将实验分为五种配置,分别隔离「是否有 Astra 规划」「规划是否用于过滤动作」「动作选择器是随机还是 JEV」三个变量。核心结果如下:

  • 纯随机(Pure random):0 胜 / 10 负
  • 仅 JEV(JEV-only):0 胜 / 10 负
  • Astra 约束 + 随机:0 胜 / 10 负
  • Astra 约束 + JEV:9 胜 / 1 负
  • Astra 建议 + JEV:3 胜 / 3 平 / 4 超时

可以看到,只有当 LLM 规划被用于「过滤候选动作」并由 JEV 做最终选择时,AI 才能稳定击败 Lv7 内置 AI;仅仅给出建议而不约束动作空间,效果明显下降。

微观对战:35 张地图测试

微观模块在 SMAC-Hard 的 35 张地图上、每张图跑 3 局进行评估。三种版本的结果如下:

  • 仅 JEV:3 胜 / 2 平 / 100 负
  • 早期 Astra + JEV:6 胜 / 1 平 / 98 负
  • P0 Astra + JEV:7 胜 / 98 负

剔除两张开发用地图后,三者的胜场分别为 3/99、3/99、7/99。这一结果远低于宏观模块,说明在高频、近实时的微操场景下,纯 LLM 规划仍难以与专门的强化学习方法竞争。

性能与运行开销

项目在推理过程中游戏帧持续推进,因此响应延迟会直接影响对战表现。在主要批次中,JEV 共产生 19,605 次响应,Astra 产生 509 次响应。JEV 的中位响应时间为:

  • JEV-only:0.391 秒
  • 受约束模式:0.375 秒
  • 建议模式:0.421 秒

Astra 在建议模式下不再过滤动作,但仍提供上下文并保留 20 秒的部队指令防护窗口;撤退在基础规则下依然可用。

运行与复现

推荐环境为 Windows + Python 3.10 + SC2 5.0.16.97563(亚洲区)。项目为宏观和微观模块分别提供独立虚拟环境,并要求事先安装 SC2 客户端、生成 stableid.json,再同步 BurnySC2 枚举。运行示例命令包括:

  • py -3.10 jev_star.py macro --planner codex --planner-effort medium --map 'Altitude LE' --opponent-race Zerg --difficulty Easy
  • py -3.10 jev_star.py micro --map 3m --episodes 3 --planner codex --planner-effort medium

代码库同时附带 140 个宏观和 37 个微观的离线测试用例,无需联网对战即可验证。整体来看,JEV-Star 更像是用 LLM 验证「低成本、可复现」游戏 AI 控制的探索,而非对前沿模型能力的展示。

信源