NVIDIA-NeMo/Gym

Evaluate and improve models and agents using environments

解決する課題

NeMo Gymは、AIモデルおよびエージェント、特にコード実行、ツール呼び出し、サンドボックスなどのステートフルな環境で動作するもの、を評価および改善するために設計されています。数千の同時リクエストにわたって評価とトレーニングを実行できるスケーラブルなインフラストラクチャを提供し、共有環境と検証者(verifier)を使用することで、チーム間での再現性を確保します。

仕組み

このライブラリは、モジュール式システムを採用しています。「環境(environment)」は、タスクのデータセット、エージェントハーネス(モデルが世界とどのように相互作用するか)、および検証者(タスクの完了がどのようにスコア付けされるか)で構成されます。さまざまな推論プロバイダー(vLLM、OpenAI、Together.aiなど)やトレーニングフレームワーク(NeMo RL、Unsloth、VeRLなど)と統合されており、評価からエージェントの最適化およびトレーニングへのシームレスな移行を可能にします。

対象者

大規模で再現可能な評価を実行する必要がある、あるいは教師あり微調整(SFT)および強化学習(RL)トレーニング用の環境を必要とする、AIエージェントおよびLLMの研究者や開発者を対象としています。

ハイライト

  • スケーラブルな評価: 高スループットの評価とトレーニングのために、数千の同時実行環境をサポート。
  • 環境ハブ: コーディング、知識、科学などのドメインにわたる、一般的なベンチマークとトレーニング環境のコレクション。
  • プラグイン可能なサンドボックス: さまざまなサンドボックスプロバイダーを介して、ツールを使用するエージェントを隔離された環境で実行する機能。
  • モジュール式アーキテクチャ: エージェント、タスク、検証者のための拡張可能なインターフェースにより、ユーザーは独自のエージェントを持ち込んだり、組み込みのハーネスを使用したりできます。
  • 統合されたエコシステム: NVIDIA NeMoプラットフォームの一部であり、GPU加速トレーニングおよび最適化ツールと統合されています。