DelveRL开源:让智能体下地牢

DelveRL 近日开源,以回合制 Roguelike、确定性模拟和无渲染批量运行降低游戏智能体训练门槛。项目附带循环 PPO 基线,中位成绩达到第 18 层,长局可推进至第 33 层。
近日,开发者 SnyderConsulting 开源了 DelveRL,一款从零开始为游戏智能体训练设计、同时允许人类直接游玩的无尽回合制 Roguelike。项目把结构化接口、确定性模拟、程序化关卡、部分可观测、无渲染批量环境和循环 PPO 训练器放进同一套本地工具链,并公开了训练代码、检查点、桥接文档与原始基准数据。
DelveRL 的价值不在于又做了一款地牢游戏,而在于试图解决游戏强化学习最麻烦的工程问题:环境接入成本。许多现成游戏确实有复杂机制和足够高的策略上限,但研究者往往要先处理画面捕获、键鼠模拟、游戏进程管理、状态同步和不可控随机性,才能让智能体真正开始训练。DelveRL 则反过来把游戏围绕智能体接口来设计,让“能玩”和“能训练”成为同一套系统的两个入口。
截至 2026 年 8 月 22 日,项目作者公布的内置基线中位成绩为第 18 层,较长的运行轨迹能够到达第 33层。这个结果足以证明环境和训练链路能够工作,但还不能证明 DelveRL 已经成为成熟基准:目前公开信息没有给出统一算力预算、训练步数、随机种子数量、置信区间以及跨算法复现结果,数字现阶段更适合作为可运行基线,而不是排行榜结论。

DelveRL 是什么
DelveRL 是一个专门面向游戏智能体训练的无尽回合制 Roguelike 环境。智能体需要在程序化生成的楼层中探索地图、管理生命与资源、评估战斗风险、处理敌人,并找到出口进入下一层;随着楼层持续推进,单局轨迹会逐渐变长,错误决策的累积成本也会越来越高。
Roguelike 是一类强调程序化地图、资源稀缺、风险管理和失败惩罚的游戏类型。它天然适合强化学习研究,因为智能体面对的不是一次分类或一道静态问答,而是一连串相互影响的决策:现在多走一步探索,也许能获得补给,也可能暴露在敌人攻击范围内;现在消耗资源保命,则可能导致后续楼层缺少恢复手段。
回合制机制是 DelveRL 对训练稳定性最重要的选择之一。实时游戏要求智能体同时处理反应延迟、动作持续时间和帧率波动,而回合制环境通常遵循“观察一次、选择一次、环境推进一次”的节奏,更容易定义动作边界,也更容易定位一条失败轨迹究竟错在哪里。
无尽楼层结构是 DelveRL 区别于固定长度关卡的另一项设计。固定终点任务容易被智能体记住有限路线,无尽推进则更接近持续生存测试,既能衡量短期战斗能力,也能观察策略在长轨迹中是否出现资源透支、状态遗忘和风险偏好失控。
五项设计决定了它是否真的好用
1. 结构化接口把游戏状态变成训练数据
结构化接口是让智能体以机器可读形式接收观察并提交动作的交互层。它避免研究者把屏幕截图、键盘输入和窗口焦点管理拼成一套脆弱的自动化脚本,也使状态记录、轨迹回放和批量评估更容易实现。
结构化并不等于已经兼容所有主流强化学习框架。作者目前确认的是 DelveRL 提供了 structured API 和 bridge documentation,但参考资料没有明确说明它是否原生遵循 Gymnasium、PettingZoo 或其他接口规范,也没有公开观测张量尺寸、动作空间数量和奖励函数明细,因此开发者仍需以仓库文档为准,不能仅凭“结构化接口”推断为即插即用。
2. 确定性模拟让实验可以复现
确定性模拟是指在初始状态、随机种子和动作序列相同的条件下,环境能够产生相同结果。对强化学习来说,这相当于给复杂游戏加上“实验回放键”:研究者可以重新执行某次失败轨迹,判断问题来自策略本身、随机事件还是环境实现。
确定性也使算法对比更公平。两个智能体可以面对相同地图、敌人分布和事件序列,评估差异不必完全淹没在随机波动中;不过,高质量评估仍然必须覆盖多个未见种子,否则智能体可能只是对少量可重复地图形成过拟合。
3. 程序化生成测试的是真正泛化
程序化关卡是由规则和随机种子动态生成的地图与事件组合。它能不断改变房间布局、敌人位置和资源分布,让智能体无法只记住一条最优路线,而必须学习更一般的探索、战斗和资源管理策略。
程序化生成的难点不只是“地图每次不同”。如果生成器产生的关卡分布过窄,智能体仍然可能记住局部模板;如果难度跨度过大,奖励会变得稀疏,训练则可能长时间无法形成有效策略。DelveRL 后续能否成为研究基准,很大程度上取决于关卡分布是否可配置、训练与测试种子是否严格隔离,以及不同难度层级能否稳定复现。
4. 部分可观测迫使智能体拥有记忆
部分可观测是指智能体在单个时间步只能看到环境的一部分,无法直接获得完整世界状态。地牢中的未探索区域、离开视野的敌人和先前发现的资源都会形成信息缺口,智能体必须根据历史观察维护内部状态。
部分可观测让 DelveRL 比完整棋盘类任务更接近真实智能体问题。一个只根据当前画面反应的策略,可能反复经过同一路口、忘记危险区域或丢失出口线索;一个具备记忆的策略,则需要把过去信息压缩成可持续更新的内部表征。
5. 无渲染批量环境直接影响训练吞吐
无渲染批量环境是指同时运行多个不绘制画面的游戏实例,只输出训练所需状态。强化学习通常需要数百万乃至更多环境步,真正限制速度的经常不是神经网络,而是游戏绘制、窗口管理和实例切换。
全部本地运行则减少了外部服务延迟和实验依赖。研究者可以在同一台机器上启动多份环境、收集轨迹并更新策略,也更容易冻结版本、保存随机种子和复现结果;但作者尚未披露每秒环境步数、推荐硬件和内存占用,因此 DelveRL 的实际吞吐优势仍需要第三方测试验证。
自带循环 PPO,但第 18 层只是起跑线
PPO 是一种通过限制策略更新幅度来提高训练稳定性的策略梯度算法,全称为 Proximal Policy Optimization。它不是最新的强化学习算法,却长期被当作可靠基线,因为实现相对直接、超参数较为可控,也适合离散动作环境。
循环策略是带有跨时间步记忆状态的策略网络,通常使用 RNN、GRU 或 LSTM 一类循环结构。DelveRL 内置 recurrent PPO trainer,意味着基线并非只看当前观察,而是能够把此前探索和战斗信息写入隐藏状态,这与部分可观测地牢的任务结构是匹配的。
作者报告的基线中位数为第 18 层,扩展运行可到达第 33 层。中位数比单次最高分更有意义,因为它不容易被极少数幸运轨迹拉高;但“扩展运行达到第 33 层”究竟代表最佳单局、较长评估时长还是不同训练配置,目前资料没有提供足够细节,二者不能直接视为同一统计口径。
| 已公开基线信息 | 数值或状态 | 应如何理解 | |---|---:|---| | 中位推进楼层 | 18 层 | 代表典型基线表现,比单次最高成绩更有参考价值 | | 较长运行推进楼层 | 33 层 | 说明策略有能力完成更长轨迹,但统计口径尚不明确 | | 训练算法 | 循环 PPO | 适配部分可观测任务,并提供可复现起点 | | 运行方式 | 全部本地 | 环境采样和训练不依赖远程服务 | | 并行能力 | 支持批量、无渲染环境 | 有利于提升采样效率,具体吞吐量未披露 | | 开放内容 | 游戏、训练代码、检查点、桥接文档、原始基准 | 降低从安装到复现实验的门槛 | | 未明确指标 | 训练步数、算力、种子数、置信区间 | 暂时不适合与其他环境做绝对性能比较 |
DelveRL 最值得期待的结果不是 PPO 再多推进几层,而是基线被不同方法快速击败。世界模型、分层强化学习、内在奖励、地图记忆、离线轨迹预训练和具备规划能力的语言模型智能体,都可以在同一环境里检验;如果每种方法都能用统一种子和预算报告楼层分布,DelveRL 才可能从个人开源项目变成真正有说服力的研究场地。
它与 NLE、MiniHack 和 Procgen 有什么不同
DelveRL 的定位更接近“为训练重新设计一款完整游戏”,而不是给已有商业游戏外挂控制层。这个思路牺牲了现成游戏的内容规模,却换来了更整洁的状态定义、更可控的随机性,以及从人类试玩到批量训练的一致环境。
| 环境 | 核心定位 | 主要观察形态 | 任务结构 | 接入与研究特点 | |---|---|---|---|---| | DelveRL | 为智能体训练从零设计的无尽回合制 Roguelike | 结构化观察,具体规格待文档确认 | 探索、战斗、资源管理、逐层逃生 | 本地运行,确定性模拟,自带循环 PPO 与检查点 | | NetHack Learning Environment(NLE) | 基于 NetHack 的复杂长期决策环境 | 游戏内部状态与字符化信息 | 极长程、高难度、机制密集 | 研究历史较长,但任务复杂度和学习门槛很高 | | MiniHack | 基于 NLE 构建的可配置任务平台 | 继承 NetHack 体系 | 从导航、技能到组合任务 | 更适合构造课程和受控子任务,不以完整无尽游戏为唯一目标 | | Procgen Benchmark | 测试视觉强化学习泛化能力的程序化游戏集合 | 像素图像 | 16 个不同玩法的短局游戏 | 强调训练关卡与测试关卡之间的泛化,偏视觉策略 |
NLE 的优势是机制深度和长期研究积累,而它的劣势也来自同一件事:NetHack 本身极其复杂。智能体可能在获得稳定奖励之前就遇到庞大物品系统、状态效果和长程依赖,研究者很难区分算法失败究竟源于探索、表示学习还是游戏知识不足。
MiniHack 的优势是可以把复杂地牢拆成更小、更可控的任务。它适合研究导航、技能组合和课程学习,而 DelveRL 从现有描述看更强调一款完整可玩的无尽游戏,以及在统一循环里同时考察探索、战斗和资源管理。
Procgen 的优势是用多种程序化视觉游戏衡量泛化。它更像一套视觉强化学习考卷,DelveRL 则更像一场持续进行的地牢生存赛:前者关注跨关卡分布表现,后者更容易把记忆、长期资源规划和风险控制压进一条越来越长的轨迹。
真正的亮点是“训练闭环完整”
DelveRL 当前最强的产品判断,是作者没有只发布一个环境壳,而是连同训练器、检查点、文档和原始结果一起开放。强化学习项目最常见的问题是环境可以启动,但奖励定义不清、训练配置缺失、结果无法复现;一个能直接跑通的弱基线,往往比一张漂亮但孤立的成绩表更有价值。
原始基准数据尤其值得重视。只公布平均分会隐藏失败率、长尾轨迹和不同随机种子间的剧烈波动,而原始数据允许研究者重新计算中位数、分位数、存活曲线和置信区间,也能检查第 33 层是偶然长尾还是稳定能力。
人类可玩性同样不是装饰。研究者可以亲自体验奖励是否符合直觉、观察哪些决策需要长期记忆,并把人类轨迹用作模仿学习或离线强化学习数据;如果智能体采取明显违反常识却能刷分的策略,人类试玩也更容易暴露奖励漏洞。
DelveRL 还需要补齐三块拼图
DelveRL 要成为可信基准,首先需要固定评估协议。项目应明确训练环境步数、评估回合数、随机种子划分、每局最大步数、模型参数量和硬件预算,并同时报告中位楼层、均值、四分位区间和失败原因,而不是只比较最好成绩。
DelveRL 要吸引更多算法实现,其次需要稳定的环境兼容层。结构化接口已经是正确方向,但如果能进一步提供明确的观察空间、动作空间、终止条件、版本编号和主流框架适配,研究者才能把时间花在算法上,而不是重复编写包装器。
DelveRL 要验证泛化能力,最后需要防止训练种子泄漏。程序化生成并不自动等于泛化,可靠做法是公开互不重叠的训练、验证和测试种子集合,并增加分布外测试,例如提高敌人密度、改变资源稀缺程度或组合训练阶段未出现的地图结构。
结论:小项目,但切中了智能体训练的真问题
DelveRL 目前更像一个设计方向正确、工程闭环完整的新环境,而不是已经得到广泛验证的标准基准。它没有依靠超大模型或昂贵算力制造声量,而是把接口、复现、并行采样、程序化泛化和部分可观测这些真正影响强化学习实验效率的环节提前做好。
第 18 层的中位成绩给了社区一条清晰起跑线,第 33 层的长局结果则展示了环境拥有继续优化的空间。接下来最关键的不是作者再提交一个更高分,而是第三方能否在相同预算下复现结果,并用不同算法稳定超过循环 PPO。
如果 DelveRL 能补齐标准评估协议、吞吐数据和框架兼容信息,它会是一块很实用的游戏智能体试验田。对于想研究长期规划、记忆、探索和资源管理,又不想先花数周改造现成游戏的开发者,这类“训练优先”的 Roguelike,确实比又一个像素小游戏更有用。
参考来源
- Reddit:DelveRL 作者发布的项目介绍:说明环境设计目标、本地批量运行能力、循环 PPO 基线以及第 18 层和第 33 层成绩。
- GitHub:NetHack Learning Environment:基于 NetHack 的强化学习研究环境,用于对比复杂长程 Roguelike 基准。
- GitHub:MiniHack:建立在 NLE 之上的可配置任务平台,用于导航、技能和组合任务研究。
- GitHub:OpenAI Procgen Benchmark:包含 16 个程序化生成游戏的视觉强化学习泛化基准。



