NVIDIA-NeMo/Gym
Evaluate and improve models and agents using environments
何を解決するか
NeMo Gym は、状態を持つ環境で動作する AI モデルやエージェントの評価と改善を目的としたライブラリです。単純な出力のステートレスチェックでは不十分な、コード実行、ツール呼び出し、サンドボックス環境など複雑なタスクにおいて、チーム間で再現可能でスケーラブルな評価とトレーニングを実行する課題に対処します。
動作方法
このライブラリは、4つの主要なコンポーネントからなるモジュール式インフラを提供します:データセット(解決すべきタスク)、エージェントハーネス(モデルが世界とどのように相互作用するか)、検証者(タスク完了のスコアリング)、および状態(各タスクの実行コンテキスト)。モデル、エージェント、タスク検証プロセスの間をローカルサーバーで調整します。数千もの同時環境にスケーリングでき、NeMo RL、Unsloth、VeRL などのさまざまなトレーニングフレームワークと統合され、SFT および RL トレーニングが可能になります。
対象ユーザー
状態を持つ複雑な環境で大規模かつ再現可能な評価、および評価駆動型トレーニング(RLHF/RL)を必要とする、AI エージェントや LLM に取り組む開発者や研究者向けです。
特徴
- スケーラブルな評価:数千もの同時環境と、タスクごとの複数回の繰り返しをサポート。
- モジュールアーキテクチャ:エージェント、タスク、検証者のインターフェースを拡張可能。
- 環境ハブ:コード、推論、指示追従など、さまざまな分野の有名なベンチマークやトレーニング環境のコレクションを含む。
- トレーニング統合:評価からエージェント最適化および RL トレーニングへのスムーズな移行を可能にする。
- 可観測性:エージェント、モデル、リソースサーバー間のオプションの OpenTelemetry トレーシング。
- プラグイン式サンドボックス:Docker、Daytona、ECS Fargate など、複数のサンドボックスプロバイダーをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト