NVIDIA-NeMo/Gym
Evaluate and improve models and agents using environments
解決する課題
NeMo Gymは、AIモデルおよびエージェント、特にコード実行、ツール呼び出し、サンドボックスなどのステートフルな環境で動作するもの、を評価および改善するために設計されています。数千の同時リクエストにわたって評価とトレーニングを実行できるスケーラブルなインフラストラクチャを提供し、共有環境と検証者(verifier)を使用することで、チーム間での再現性を確保します。
仕組み
このライブラリは、モジュール式システムを採用しています。「環境(environment)」は、タスクのデータセット、エージェントハーネス(モデルが世界とどのように相互作用するか)、および検証者(タスクの完了がどのようにスコア付けされるか)で構成されます。さまざまな推論プロバイダー(vLLM、OpenAI、Together.aiなど)やトレーニングフレームワーク(NeMo RL、Unsloth、VeRLなど)と統合されており、評価からエージェントの最適化およびトレーニングへのシームレスな移行を可能にします。
対象者
大規模で再現可能な評価を実行する必要がある、あるいは教師あり微調整(SFT)および強化学習(RL)トレーニング用の環境を必要とする、AIエージェントおよびLLMの研究者や開発者を対象としています。
ハイライト
- スケーラブルな評価: 高スループットの評価とトレーニングのために、数千の同時実行環境をサポート。
- 環境ハブ: コーディング、知識、科学などのドメインにわたる、一般的なベンチマークとトレーニング環境のコレクション。
- プラグイン可能なサンドボックス: さまざまなサンドボックスプロバイダーを介して、ツールを使用するエージェントを隔離された環境で実行する機能。
- モジュール式アーキテクチャ: エージェント、タスク、検証者のための拡張可能なインターフェースにより、ユーザーは独自のエージェントを持ち込んだり、組み込みのハーネスを使用したりできます。
- 統合されたエコシステム: NVIDIA NeMoプラットフォームの一部であり、GPU加速トレーニングおよび最適化ツールと統合されています。