大家好!想跟各位分享一下我最近在做的一个项目
我受了 DeepMind 和 OpenAI 一些项目的启发,但发现大多数游戏都很难接入智能体训练框架所以我从零做了 DelveRL:它既是个能让人玩的游戏,也带了一套结构化接口,模拟过程完全确定,关卡随机生成,信息不完全可见,而且策略空间足够大,智能体能在里面互相较量不断进步
这是个无限关卡的回合制 Roguelike智能体得探索地图权衡风险和资源打怪,并从每一层逃出去整套东西都能在本地跑,包括批量无渲染环境和一套循环 PPO 训练器
自带的基线模型中位数能通到第 18 层,跑久一点能到第 33 层游戏训练代码模型存档接口文档和原始测试数据现在全都开源了
我很期待大家会尝试什么思路,也想看看基线成绩多久就会被刷爆