NVIDIA-NeMo/Gym

Evaluate and improve models and agents using environments

해결하는 문제

NeMo Gym은 AI 모델 및 에이전트, 특히 코드 실행, 도구 호출 및 샌드박스와 같은 상태 유지 환경에서 작동하는 모델을 평가하고 개선하도록 설계되었습니다. 수천 개의 동시 요청에 걸쳐 평가 및 학습을 실행할 수 있는 확장 가능한 인프라를 제공하며, 공유 환경 및 검증기(verifier)를 사용하여 팀 간의 재현성을 보장합니다.

작동 방식

이 라이브러리는 모듈식 시스템을 사용합니다. 여기서 "환경(environment)"은 작업 데이터셋, 에이전트 하네스(모델이 세상과 상호작용하는 방식) 및 검증기(작업 완료 점수를 매기는 방식)로 구성됩니다. 다양한 추론 제공업체(vLLM, OpenAI, Together.ai 등) 및 학습 프레임워크(NeMo RL, Unsloth, VeRL 등)와 통합되어 평가에서 에이전트 최적화 및 학습으로의 원활한 전환을 지원합니다.

대상 사용자

대규모의 재현 가능한 평가를 수행하거나 지도 미세 조정(SFT) 및 강화 학습(RL) 학습을 위한 환경이 필요한 AI 에이전트 및 LLM 분야의 개발자와 연구자를 대상으로 합니다.

주요 특징

  • 확장 가능한 평가: 고처리량 평가 및 학습을 위해 수천 개의 동시 환경을 지원합니다.
  • 환경 허브: 코딩, 지식, 과학과 같은 다양한 도메인에 걸친 인기 있는 벤치마크 및 학습 환경 컬렉션입니다.
  • 플러그형 샌드박스: 다양한 샌드박스 제공업체를 통해 도구 사용 에이전트를 격리된 환경에서 실행할 수 있습니다.
  • 모듈형 아키텍처: 에이전트, 작업 및 검증기를 위한 확장 가능한 인터페이스를 통해 사용자가 자체 에이전트를 가져오거나 내장된 하네스를 사용할 수 있습니다.
  • 통합된 생태계: NVIDIA NeMo 플랫폼의 일부로, GPU 가속 학습 및 최적화 도구와 통합됩니다.