open-compass/opencompass
OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.
何を解決するか
OpenCompassは、大規模言語モデル(LLM)および大規模視覚言語モデル(LVLM)の評価を統合的・公正・再現可能に実現するプラットフォームです。複数の異なるベンチマークを手動で実行する必要を排除し、さまざまな次元でのモデル品質と効果を一元的に評価できるワンストップシステムを提供します。
動作方法
OpenCompassはモジュール構造を採用しており、HuggingFace、API、カスタムインターフェースを介してさまざまなモデルとデータセットを統合できます。ゼロショット、フェイショット、チェーンオブシンス(CoT)など、複数の評価パラダイムをサポートし、CLIまたはPythonスクリプトで構成可能です。効率性のため、10億スケールのモデルを処理できる分散評価を実装し、vLLMやLMDeployなどの加速バックエンドと統合しています。
対象ユーザー
モデルの業界標準とのベンチマーク、オープンソースモデルとプロプライエタリAPIモデルの比較、新しい評価ベンチマークの開発が必要なAI研究者や実務家向けに設計されています。
主な特徴
- 広範な互換性: 20以上のモデル、70以上のデータセット、約40万問の質問をサポート。
- 分散評価: タスク分割により、大規模評価タスクを数時間で完了可能。
- 柔軟なパラダイム: ゼロショット、フェイショット、CoT評価をカスタマイズ可能なプロンプトテンプレートでサポート。
- LLM-as-Judge:
GenericLLMEvaluatorなどのツールにより、LLMを他のモデル出力の評価に活用可能。 - マルチモーダル対応: VLMEvalKitと統合し、ネイティブなマルチモーダルデータセットの読み込みと評価を実現。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト