EleutherAI/lm-evaluation-harness

A framework for few-shot evaluation of language models.

解決する課題

このプロジェクトは、多種多様な評価タスクにわたって生成言語モデルをテストするための統一フレームワークを提供します。異なるモデルごとに個別の断片化されたベンチマークを実行する必要性をなくし、研究者や開発者が標準的な学術ベンチマークを使用して、LLMのパフォーマンスを一貫性のある再現可能な方法で比較できるようにします。

仕組み

このハーネスは、さまざまなモデルバックエンドと評価タスクライブラリ間の標準化されたインターフェースとして機能します。Hugging Face transformers、vLLM、NVIDIA NeMo、Megatron-LM、および商用API(OpenAIなど)など、幅広いモデル読み込み方法をサポートしています。このフレームワークを使用すると、CLIまたはPython APIを介してモデル、一連のタスク(例:hellaswag)、および設定オプションを指定でき、プロンプト生成、モデル推論、およびメトリック計算が自動的に処理されます。

対象者

AI研究者、LLM開発者、および組織(NVIDIA、Cohere、Mosaic MLなど)向けに設計されており、業界標準のベンチマークに対してモデルの能力を厳密に評価し、比較可能性とOpen LLM Leaderboardとの整合性を確保する必要があるユーザーに最適です。

ハイライト

  • 広範なベンチマークライブラリ: 数百のサブタスクを含む60以上の標準的な学術ベンチマークが含まれています。
  • 幅広いモデルサポート: Hugging Face、vLLM、Megatron-DeepSpeed、NVIDIA NeMo、および商用APIと互換性があります。
  • 柔軟な並列処理: データ並列評価、モデルシャーディング(accelerate経由)、およびネイティブのPyTorch Tensor Parallelismをサポートしています。
  • カスタマイズ性: カスタムプロンプト、評価メトリック、およびYAMLベースのタスク設定が可能です。
  • マルチモーダルプロトタイピング: テキスト+画像のマルチモーダル入力タスクの実験的サポート。
  • 業界標準: Hugging Face Open LLM Leaderboardのバックエンドとして機能します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト