桃子桃子快讯
返回首页
工具

开发者开源 DelveRL:专为训练游戏智能体打造的 Roguelike 环境

独立开发者开源 DelveRL,一款专为强化学习智能体设计的回合制 Roguelike 训练环境,含 PPO 基线与基准…

2026.08.23 · 周日3 分钟阅读

一位独立开发者在 Reddit r/MachineLearning 社区开源了名为 DelveRL 的项目:一款专为训练游戏智能体设计的回合制 Roguelike 游戏,同时配套发布了完整的训练框架、基线检查点与基准数据。作者表示,灵感来自 DeepMind 与 OpenAI 的相关工作,但在尝试把现有游戏接入智能体框架时遇到诸多障碍,因此决定从零开始构建这一环境。

设计理念:为智能体而非为人类优化

DelveRL 在设计之初就明确以「可被智能体使用」为优先目标,而不是事后改造一款现成游戏。项目目标包括:

  • 提供结构化的 API,方便外部智能体直接与环境交互;
  • 保证模拟的确定性,便于实验复现;
  • 程序化生成关卡,提升泛化训练价值;
  • 引入部分可观测性,更贴近真实决策场景;
  • 保留足够的策略深度,让智能体之间存在改进空间。

作者强调,整个项目完全在本地运行,无需依赖外部服务,适合大规模实验。

游戏玩法与训练目标

DelveRL 是一款「无尽」的回合制 Roguelike。智能体(也包括人类玩家)需要:

  • 探索每一层地图;
  • 管理风险与资源;
  • 与敌人战斗;
  • 最终成功逃离当前层并进入下一层。

这种「逐步推进」的玩法天然契合回合制决策,也方便在每一步采集状态—动作—奖励数据用于强化学习训练。

技术实现要点

项目在工程上针对智能体训练做了几项关键优化:

  • 提供批量化(batched)的无渲染器(renderer-free)环境,可并行运行大量实例以加速数据采集;
  • 内置基于循环神经网络(recurrent)的 PPO(Proximal Policy Optimization)训练器;
  • 配套发布桥接文档(bridge documentation),帮助用户快速接入自己的智能体。

基线表现与开源内容

根据作者公布的数据,使用项目自带的基线训练得到的智能体:

  • 中位数表现可到达第 18 层;
  • 在更充分的训练下,最高可到达第 33 层。

项目目前完全开源,包含:

  • 游戏本体;
  • 训练代码;
  • 已训练好的检查点(checkpoint);
  • 智能体桥接文档;
  • 原始基准(benchmark)数据。

社区期待

作者在帖子末尾向社区发出邀请,希望看到研究者尝试不同的智能体方案,并期待看到社区提出的方法能够「很快超越」当前基线水平。作为一个轻量、完全本地化、且以 RL 训练为核心目标的 Roguelike 环境,DelveRL 为有兴趣研究游戏智能体的小团队和个人研究者提供了一个门槛较低的实验平台。

信源