桃子桃子快讯
返回首页
研究论文

Opus 5 一句话搓出 3A 游戏?卡帕基泼冷水

开发者用 Opus 5 提示词生成多款浏览器级游戏原型,但 Karpathy 指出模型无法实时感知自己产出,距离真正可玩…

2026.08.10 · 周一4 分钟阅读

Claude Opus 5 自 7 月 24 日发布以来,一批开发者尝试用单一提示词在浏览器内直接生成可运行的 3D 游戏,覆盖赛艇、FPS、即时战略、奇幻世界漫游等类型。AI 投资人 Matt Shumer 用一份要求模型「达到使命召唤级 AAA 品质」的提示词,配合子代理评审循环,由 Opus 5 自行产出代码、纹理、物理与敌人行为;开发者 Vyom 则用约 6.86 万输入 token 与 460 万输出 token(合计花费约 632.65 美元)生成赛艇游戏 Wave Racer,代码已开源到 GitHub。

相比之下,Andrej Karpathy 的《指环王》实验成本骤降。他把原著首段文本和 1M token 的预算(约 10 美元)交给 Opus 5,两小时后得到约 5500 行代码,运行出一个程序生成的中土世界浏览器项目。这些实践说明,模型可以在单次会话内把几何、纹理、物理与控制逻辑写进同一个 HTML 文件,跳过传统资产拼装流程,输出在视觉和交互上均可演示的原型。

Karpathy 的冷水:模型写得出,但「看不见」

Karpathy 在实验中明确指出一个根本性短板:Opus 5 在生成渲染代码时,需要在不同时间点截取静态截图,再依据这些截图推断运行时状态,结果仍多次出现错误。他将这一现象总结为大语言模型的弱项 —— 它们难以高效、原生地感知视频,也无法真正参与所生成的游戏本身。具体表现为:

  • 模型能写出令赛车水面漂移的代码,却无法察觉「连续三个 S 弯之后玩家开始烦躁」。
  • 模型靠截图与静态代码分析做评估,其精度和覆盖范围远低于真正的运行时评测。
  • 当生成成本趋近于零,「能判断输出好坏的眼光」反而成为稀缺资源,懂得检查和批评模型输出的人将更有价值。

工程方向的现实路径

要让模型在游戏领域真正可用,研究层面有几条务实路线。自动化游戏测试领域已探索让 LLM 智能体以多模态感知捕获游戏状态,在执行后自我反思、识别卡顿与崩溃,再调整策略,逐步把「截图 → 分析 → 行动」压缩成接近实时的反馈闭环。这种用架构弥补感知短板的思路,被视为目前最接地气的工程解法。

更深层的瓶颈来自训练数据。模型知道如何写正确的法线贴图 WebGL 代码,因为这类语料在网上大量存在;但「玩家在走廊哪个转角会感到压迫」「武器后坐力多强才不失控」「何种奖励节奏让人想再开一关」,这类手感、节奏与挫败感判断并未以代码形式沉淀到网上。这与 AlphaGo 通过自我对弈积累棋感相似,但游戏世界复杂度与感知接口都宽得多,路径要长很多。

当下判断

Wave Racer、Shumer 的 FPS、@mikeluan123 的太空 RTS、Karpathy 的中土世界都有可玩性,但「一份提示词打穿《使命召唤》」在 2026 年这个夏天仍未发生。开发者 Leon Lin 提供的对照实验显示:用一份 20 章详细设计文档驱动 Opus 5 时,输出稳定性明显优于「短提示版本」,前提是文档本身凝结了人类多年的 AAA 经验。

生成能力让游戏原型门槛前所未有地下沉,而对模型产出的鉴赏、测试与批评能力正在反向升值。在模型真正学会「玩自己做的游戏」、能从第七关节奏的崩塌中学到设计教训之前,对生成式游戏保持兴奋,同时用挑剔眼光审视那份兴奋,是当前最务实的姿态。

信源