NVIDIA-NeMo/Gym

Evaluate and improve models and agents using environments

何を解決するか

NeMo Gym は、状態を持つ環境で動作する AI モデルやエージェントの評価と改善を目的としたライブラリです。単純な出力のステートレスチェックでは不十分な、コード実行、ツール呼び出し、サンドボックス環境など複雑なタスクにおいて、チーム間で再現可能でスケーラブルな評価とトレーニングを実行する課題に対処します。

動作方法

このライブラリは、4つの主要なコンポーネントからなるモジュール式インフラを提供します:データセット(解決すべきタスク)、エージェントハーネス(モデルが世界とどのように相互作用するか)、検証者(タスク完了のスコアリング)、および状態(各タスクの実行コンテキスト)。モデル、エージェント、タスク検証プロセスの間をローカルサーバーで調整します。数千もの同時環境にスケーリングでき、NeMo RL、Unsloth、VeRL などのさまざまなトレーニングフレームワークと統合され、SFT および RL トレーニングが可能になります。

対象ユーザー

状態を持つ複雑な環境で大規模かつ再現可能な評価、および評価駆動型トレーニング(RLHF/RL)を必要とする、AI エージェントや LLM に取り組む開発者や研究者向けです。

特徴

  • スケーラブルな評価:数千もの同時環境と、タスクごとの複数回の繰り返しをサポート。
  • モジュールアーキテクチャ:エージェント、タスク、検証者のインターフェースを拡張可能。
  • 環境ハブ:コード、推論、指示追従など、さまざまな分野の有名なベンチマークやトレーニング環境のコレクションを含む。
  • トレーニング統合:評価からエージェント最適化および RL トレーニングへのスムーズな移行を可能にする。
  • 可観測性:エージェント、モデル、リソースサーバー間のオプションの OpenTelemetry トレーシング。
  • プラグイン式サンドボックス:Docker、Daytona、ECS Fargate など、複数のサンドボックスプロバイダーをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト