NVIDIA-NeMo/Gym

Evaluate and improve models and agents using environments

해결하는 문제

NeMo Gym은 상태를 가진 환경에서 작동하는 AI 모델과 에이전트를 평가하고 개선하기 위해 설계된 라이브러리입니다. 코드 실행, 도구 호출, 사전 환경과 같은 복잡한 작업에서는 단순한 출력의 상태 없는 검사로는 충분하지 않기 때문에, 팀 간에 재현 가능하고 확장 가능한 평가 및 훈련 실행을 수행하는 데 어려움이 있습니다.

작동 방식

이 라이브러리는 네 가지 핵심 구성 요소로 구성된 모듈식 인프라를 제공합니다: 데이터셋(해결해야 할 작업), 에이전트 하네스(모델이 세계와 어떻게 상호작용하는지), 검증기(작업 완료 점수 매기기), 그리고 상태(각 작업에 대한 실행 컨텍스트). 모델, 에이전트, 작업 검증 프로세스 간을 로컬 서버를 통해 조율합니다. 수천 개의 동시 환경으로 확장 가능하며, NeMo RL, Unsloth, VeRL과 같은 다양한 훈련 프레임워크와 통합되어 SFT 및 RL 훈련을 지원합니다.

대상 사용자

복잡한 상태 기반 환경에서 대규모로 재현 가능한 평가 및 평가 기반 훈련(RLHF/RL)이 필요한 AI 에이전트 및 LLM을 다루는 개발자 및 연구자에게 적합합니다.

주요 특징

  • 확장 가능한 평가: 수천 개의 동시 환경과 작업당 여러 번의 반복을 지원합니다.
  • 모듈식 아키텍처: 에이전트, 작업, 검증기의 확장 가능한 인터페이스를 제공합니다.
  • 환경 허브: 코드, 추론, 지시 따르기 등 다양한 분야의 인기 있는 벤치마크 및 훈련 환경을 포함합니다.
  • 훈련 통합: 평가에서 에이전트 최적화 및 RL 훈련으로 원활하게 전환할 수 있습니다.
  • 관측성: 에이전트, 모델, 리소스 서버 간에 선택적 OpenTelemetry 추적을 지원합니다.
  • 플러그인식 사전 환경: Docker, Daytona, ECS Fargate 등 다양한 사전 환경 제공업체를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트