AI 在《万智牌》对战中击败内置机器人,完成一项曾被公认困难的非正式基准
Ethan Mollick 发文称,AI「Astra」成功自构《万智牌》套牌并在 Arena 击败机器人,完成一项长期令…
AI 研究者、沃顿商学院教授 Ethan Mollick 在社交平台 X 上发文称,一项长期令 AI 表现不佳的「非正式极客基准」近日被突破:名为 Astra 的 AI 不仅自行设计了一套《万智牌》(Magic: The Gathering)套牌,还在 Arena 平台上凭借这套牌击败了内置机器人。Mollick 同时补充说明,所设计的套牌谈不上惊艳,但具备一定的原创性,并且在实战中确实奏效。
事件背景:什么是「非正式极客基准」
在 AI 能力评测领域,除了 MMLU、HumanEval、ARC-AGI 等被广泛引用的标准化基准之外,研究者和爱好者群体还存在一类依靠特定领域难度较高的任务来「检验 AI 是否跟上人类水平」的非正式基准。这类基准通常来自桌游、智力游戏或专业软件,例如围棋、星际争霸 II,以及本次涉及的《万智牌》对局。它们之所以被关注,是因为任务同时涉及长程规划、资源调度与对抗策略,对单纯的语言生成能力提出了更高要求,曾被多代主流大模型列为难以逾越的目标。
本次突破的细节
根据 Mollick 的描述,本次通过基准的是「Astra」,但其身份与所属厂商在原帖中并未明确披露,可能指向 Google 此前展示的多模态交互助手 Project Astra,也可能为其他同名的实验性智能体,原文并未给出官方说明。原帖附带的链接指向 Arena 上的对战截图或录像,但具体轮次、对手难度、所使用套牌的牌表等关键信息均未在推文中展开,因此目前可验证的事实仅限「AI 自构套牌并战胜内置机器人」一项。
意义与局限
从研究角度看,这一进展说明当前的大模型已经具备在受规则约束的策略游戏中进行端到端行动规划与执行的能力,比以往单纯做「纸面分析」更进一步。但该结论也存在明显局限:其一,原帖为个人观察而非经过控制的实验,数据可复现性有限;其二,《万智牌》Arena 上的内置机器人难度通常低于竞技级人类玩家,无法直接等同于高水平对局;其三,套牌的「原创性」与「强度」尚无第三方评测佐证。因此,该事件更适合作为一条反映 AI 综合能力向日常复杂任务延伸的信号,而非一项具有统计意义的科学结论。
整体而言,这是一条来自权威观察者的轻量级资讯,提示 AI 在游戏策略类任务上的能力边界正在继续扩展,但暂未提供足以支撑深度技术分析的具体数据。
