NVIDIA-NeMo/Gym
Evaluate and improve models and agents using environments
解决的问题
NeMo Gym 是一个专为评估和改进 AI 模型与智能体而设计的库,特别适用于在状态化环境中运行的模型。它解决了在团队间进行可复现、可扩展的评估和训练运行的挑战,尤其是在代码执行、工具调用和沙箱环境等复杂任务中,简单的无状态模型输出检查已不足以满足需求。
工作原理
该库提供了一个模块化基础设施,包含四个关键组件:数据集(待解决的任务)、智能体 harness(模型与世界交互的方式)、验证器(评分任务完成情况)以及状态(每个任务的执行上下文)。它使用本地服务器协调模型、智能体和任务验证过程之间的交互。可扩展至数千个并发环境,并与多种训练框架(如 NeMo RL、Unsloth 和 VeRL)集成,支持 SFT 和 RL 训练。
适用人群
适用于需要在复杂、状态化环境中进行大规模、可复现的评估以及评估驱动型训练(RLHF/RL)的 AI 智能体和 LLM 开发者与研究人员。
主要亮点
- 可扩展的评估:支持数千个并发环境和每个任务的多次重复。
- 模块化架构:为智能体、任务和验证器提供可扩展的接口。
- 环境中心:包含多个领域(如编码、推理、指令遵循)的流行基准和训练环境集合。
- 训练集成:可无缝从评估过渡到智能体优化和 RL 训练。
- 可观测性:支持在智能体、模型和资源服务器之间可选的 OpenTelemetry 跟踪。
- 可插拔沙箱:支持多种沙箱提供方,包括 Docker、Daytona、ECS Fargate 等。
相关
- 项目
- 项目
- 项目
- 项目
- 项目