描述
Gymnasium 作为强化学习 (RL) 研究和开发的一个关键标准 API,提供了一套全面的参考环境。作为 OpenAI 广泛使用的 Gym 库的一个维护分支,Gymnasium 在其前代的基础上进行了改进并提供持续支持。Gymnasium 的接口设计得简单且 Pythonic,易于开发者和研究人员使用。它能够表示广泛的通用 RL 问题,促进标准化实验和基准测试。
对于从旧版 Gym 库迁移的用户,Gymnasium 提供了一个专门的迁移指南,以简化过渡过程。核心功能包括初始化环境,例如“LunarLander-v3”示例,通常会指定一个渲染模式用于可视化。该过程通常从重置环境开始以获取初始观测值。随后,智能体通过采取动作与环境进行交互,这会导致转移到新的状态,并伴随奖励以及回合终止或截断的指示。这种观测、动作和转移的迭代过程是训练 RL 智能体的基础。
Gymnasium 库正在积极维护中,其最新版本 v1.3.0 已可供使用。文档还列出了之前的版本,允许用户在需要时访问特定版本。该项目的开发是透明的,其贡献和代码可通过 GitHub 仓库访问。这种开放的方式促进了社区参与,并确保该库在不断发展的强化学习研究领域保持更新。
Gymnasium 是任何从事强化学习的人员的重要工具,从学习基础知识的学生到推动人工智能边界的资深研究人员。其标准化的 API 和多样化的环境加速了 RL 算法的开发和比较。该库对可用性的关注及其活跃的社区支持使其成为各种 RL 应用的可靠选择。
Gymnasium 文档的核心功能
强化学习的标准 API
多样化的参考环境集合
OpenAI Gym 库的维护分支
简单且 Pythonic 的接口
能够表示通用的 RL 问题
旧 Gym 环境的迁移指南
环境重置功能
用于环境转移的 step 函数
用于智能体策略的动作空间采样
观测、奖励、终止和截断跟踪
环境关闭功能
提供多个版本发布
Gymnasium 文档入门
安装:使用包管理器安装 Gymnasium。
初始化:导入库并创建环境实例。
重置:重置环境以获取初始观测值。
行动:从环境的动作空间中采样一个动作。
步进:使用选定的动作转移环境。
观测:接收下一个观测值、奖励和终止状态。
循环:重复步骤 3-6,直到回合终止或截断。
关闭:完成时关闭环境。
Gymnasium 文档的使用案例
- RL 算法开发
- 环境基准测试
- 机器人仿真
- 游戏 AI 开发
- 自主系统
- 教育工具







