NVIDIA-NeMo/Gym

Evaluate and improve models and agents using environments

解决的问题

NeMo Gym 旨在评估和改进 AI 模型及智能体,特别是那些在代码执行、工具调用和沙箱等有状态环境中运行的模型。它提供了一个可扩展的基础设施,可以在数千个并发请求中运行评估和训练任务,通过使用共享环境和验证器,确保团队间的可重复性。

工作原理

该库使用模块化系统,其中“环境 (environment)”由任务数据集、智能体驾驭程序(模型如何与世界交互)和验证器(如何对任务完成情况评分)组成。它与各种推理提供商(如 vLLM、OpenAI 和 Together.ai)以及训练框架(如 NeMo RL、Unsloth 和 VeRL)集成,实现从评估到智能体优化和训练的无缝过渡。

适用对象

面向需要进行大规模、可重复评估,或需要用于监督微调 (SFT) 和强化学习 (RL) 训练环境的 AI 智能体及 LLM 开发人员和研究人员。

亮点

  • 可扩展的评估:支持数千个并发环境,用于高吞吐量的评估和训练。
  • 环境中心:涵盖编程、知识和科学等领域的流行基准测试和训练环境集合。
  • 可插拔的沙箱:能够通过各种沙箱提供商在隔离环境中运行使用工具的智能体。
  • 模块化架构:为智能体、任务和验证器提供可扩展的接口,允许用户使用自己的智能体或使用内置的驾驭程序。
  • 集成生态系统:作为 NVIDIA NeMo 平台的一部分,与 GPU 加速训练和优化工具集成。