NVIDIA-NeMo/Gym
Evaluate and improve models and agents using environments
해결하는 문제
NeMo Gym은 AI 모델 및 에이전트, 특히 코드 실행, 도구 호출 및 샌드박스와 같은 상태 유지 환경에서 작동하는 모델을 평가하고 개선하도록 설계되었습니다. 수천 개의 동시 요청에 걸쳐 평가 및 학습을 실행할 수 있는 확장 가능한 인프라를 제공하며, 공유 환경 및 검증기(verifier)를 사용하여 팀 간의 재현성을 보장합니다.
작동 방식
이 라이브러리는 모듈식 시스템을 사용합니다. 여기서 "환경(environment)"은 작업 데이터셋, 에이전트 하네스(모델이 세상과 상호작용하는 방식) 및 검증기(작업 완료 점수를 매기는 방식)로 구성됩니다. 다양한 추론 제공업체(vLLM, OpenAI, Together.ai 등) 및 학습 프레임워크(NeMo RL, Unsloth, VeRL 등)와 통합되어 평가에서 에이전트 최적화 및 학습으로의 원활한 전환을 지원합니다.
대상 사용자
대규모의 재현 가능한 평가를 수행하거나 지도 미세 조정(SFT) 및 강화 학습(RL) 학습을 위한 환경이 필요한 AI 에이전트 및 LLM 분야의 개발자와 연구자를 대상으로 합니다.
주요 특징
- 확장 가능한 평가: 고처리량 평가 및 학습을 위해 수천 개의 동시 환경을 지원합니다.
- 환경 허브: 코딩, 지식, 과학과 같은 다양한 도메인에 걸친 인기 있는 벤치마크 및 학습 환경 컬렉션입니다.
- 플러그형 샌드박스: 다양한 샌드박스 제공업체를 통해 도구 사용 에이전트를 격리된 환경에서 실행할 수 있습니다.
- 모듈형 아키텍처: 에이전트, 작업 및 검증기를 위한 확장 가능한 인터페이스를 통해 사용자가 자체 에이전트를 가져오거나 내장된 하네스를 사용할 수 있습니다.
- 통합된 생태계: NVIDIA NeMo 플랫폼의 일부로, GPU 가속 학습 및 최적화 도구와 통합됩니다.