桃子桃子快讯
返回首页
研究论文

19 个 AI 对战《星际争霸》,冠军也打不过人类新手

Brood War Bench 榜单测试 19 款大模型打《母巢之战》,GPT-6 Astra 18 战全胜,但同样无法…

2026.09.23 · 周三4 分钟阅读

一份名为 Brood War Bench 的《星际争霸:母巢之战》大模型榜单近期在 Hacker News 上引发热议。该榜单由开发者 Ben Swerdlow 发起,共组织 19 款主流大模型进行 171 局对战,比赛在 Freestyle 云端虚拟机上运行,每局单开一台机器,全程记录游戏数据与 AI 每一步推理。结果显示,开到最高推理档位 xhigh 的 GPT-6 Astra 以 18 战 18 胜、胜率 100% 拿下榜首;同档位下 xAI 的 Grok 4.6 仅取得 2 胜 15 负,排名垫底。

Grok 苦想 43 分钟,一个兵也没上场

榜单中最戏剧性的案例是编号 G043 的对局:Grok 4.6 在 43 分钟内输出了 11138 个推理 token,发出 6 批指令,场上始终为 0 个作战单位;G003 局中它造了 3 个机枪兵却未能抵达敌方基地,G002 局中 2 个狂热者同样止步半途。在比赛进行到 11 分半时,Astra 已兵强马壮,而 Grok 场上平均只有不到 7 个农民和几个兵。值得注意的是,Grok 国库里当时躺着 928 块水晶矿,远超 Astra——钱多、推理深,但就是不动手。

Astra 的绝招:用一个农民拖死对手

如果说 Grok 是被自己想太多拖死的,Astra 则是专门逼对手想太多。它惯用一招「单农民骚扰」:派一个最基础的采矿单位横穿地图冲到敌方基地。对面的 AI 一旦看到这名不速之客,便陷入长达数十秒的疯狂计算,期间基地生产完全停滞。Astra 借此不断破坏对手经济与节奏。但作者也指出,Astra 内部像「草台班子」,管经济、管造兵、管打仗的子智能体各干各的,新兵常被直接拉去前线白给。当作者亲自下场串联各子智能体后,Astra 才懂得集结部队、把握时机。

最像在打星际的是 Fable

胜率 83.3%、排名第三的 Fable 打法最为正统:老老实实发展科技树,稳扎稳打扩经济。某局中它成功孵出飞龙,另一局甚至把神族高级建筑挨个盖齐,圣堂档案馆都已建好。然而好学生未必能拿第一——有一局它科技铺满一桌、账上躺着 2800 多块晶矿,却仍被 Claude Opus 5 的枪兵推平。Astra 对局时长中位数仅 8 分 10 秒,Fable 则被拖到 10 分 37 秒,节奏明显落后。

推理越深未必越强,账单却更便宜

榜单数据呈现一个反直觉的规律:并非推理越多越好。GPT-5.6 Sol 推理开到最高档时胜率反而垫底,medium 档表现更佳;但 Astra 却是「想得越深赢面越大」。更值得关注的是成本对比:Astra 开最高档每分钟仅操作 12.6 次,一局平均花费 10.54 美元;换成最低档,操作频率翻倍到每分钟 25.7 次,一局反而要烧掉 21.07 美元。最高档出手少一半、花钱少一半、赢得最多,体现出新一代模型已经懂得「思考是有成本的」。

七年前的 AlphaStar,为何今天模型打不过新手

2019 年 DeepMind 的 AlphaStar 曾以两个 5:0 横扫职业选手 TLO 和 MaNa,并匿名混上欧洲天梯超过 99.8% 的人类玩家。但作者指出两者本质不同:AlphaStar 是吃海量录像、靠疯狂自我对战堆出来的星际「特长生」,只学了这一件事;而今天参赛的大模型是「通才」,没有任何星际基础,每一步都需要先思考再出手。面对人类新手最爱用的光炮快攻,即便是全胜冠军也组织不起复杂阵型、执行不了长远战术。

这场测试的核心启示在于:过去几年 AI 的考题几乎都是回合制的,问来问去只有一句「你算得对不对」;但星际、自动驾驶、具身机器人所处的世界不会等它想完。下一阶段智能体的竞争点,将是谁能在有限时间里把观察、决策、执行连成一个不停转动的闭环——烧掉更多思考 token,未必换来更强的智能体。

信源