huggingface/OpenEnv
An interface library for RL post training with environments.
解决的问题
OpenEnv 提供了一种标准化的方法,用于创建、部署和交互式使用用于代理强化学习(RL)训练的隔离执行环境。它消除了为代理在安全、沙盒化的容器中运行而设置的繁琐过程,同时为强化学习框架提供了与这些环境通信的一致性 API。
工作原理
OpenEnv 采用客户端-服务器架构,环境托管在隔离的 Docker 容器中(通过 LocalDocker、Docker Swarm 或 Hugging Face Spaces 等提供者部署)。
- 服务端:环境创建者实现一个包含
reset()、step()和state()方法的基类,以定义逻辑和奖励。 - 客户端:用户通过
EnvClient使用 Gymnasium 风格的 API 与这些环境交互,通过 WebSockets 通信。 - 工具:CLI(
openenv)允许用户生成新环境、构建 Docker 镜像,并将它们推送到 Hugging Face Spaces 以实现轻松部署。
适用人群
- RL 研究人员:那些在模拟或沙盒环境中训练 LLM 或其他代理以执行任务的研究者。
- 环境创建者:构建专用模拟器或沙盒(例如编程、国际象棋、金融市场)的开发者,需要安全部署并易于访问。
主要亮点
- Gymnasium 风格 API:使用熟悉的
step()和reset()模式,实现与强化学习的无缝集成。 - 沙盒执行:确保代理在隔离容器中运行,保障安全性。
- 集成 Web 界面:包含内置 UI,支持实时调试和对代理-环境交互的交互式探索。
- 灵活部署:支持多种容器提供者,并可轻松部署到 Hugging Face Spaces。
- 广泛生态系统:与 TRL、torchforge、SkyRL 和 Oumi 等强化学习框架集成。
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- 项目