open-compass/opencompass

OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.

What it solves

OpenCompass は、大規模言語モデル(LLMs)および大規模ビジョン‑言語モデルを評価するための統一的で公平かつ再現可能なプラットフォームを提供します。さまざまなベンチマークを手動で管理する複雑さを排除し、膨大なデータセットライブラリを用いて複数の次元でモデル品質を評価するワンストップシステムです。

How it works

このプラットフォームは、コマンドラインインターフェース(CLI)または Python スクリプトを通じて評価を実行できます。HuggingFace、vLLM、LMDeploy などのさまざまな推論バックエンドと統合し、モデル実行を処理します。また、ゼロショット、Few‑Shot、Chain‑of‑Thought(CoT)といった複数の評価パラダイムをサポートします。オープンソースモデルと API ベースのモデル(例: GPT-4o)を同等に扱うことができます。複雑な評価には、カスタム評価器やシーケンシャル評価パイプライン(CascadeEvaluator)をサポートするモジュラー設計を採用しています。

Who it’s for

NLP モデルの性能をベンチマークしたい、標準化されたリーダーボードで異なる LLM を比較したい、あるいは特定モデルの推論、知識、長文コンテキストタスクにおける能力を検証したい AI 研究者やエンジニア向けに設計されています。

Highlights

  • Extensive Library: 20 以上のモデルと 70 以上のデータセットを事前にサポートし、約 40 万件の質問を含みます。
  • Distributed Evaluation: ワンクリックで分散タスクを分割し、数時間で数十億規模のモデルを評価可能です。
  • Flexible Inference: vLLM や LMDeploy などのアクセラレーションバックエンドをワンクリックで切り替えられます。
  • Diverse Paradigms: ゼロショット、Few‑Shot、CoT 評価をサポートし、プロンプトテンプレートをカスタマイズ可能です。
  • LLM-as-Judge: GenericLLMEvaluator などのツールを含み、LLM を用いて他モデルの出力を評価できます。