open-compass/VLMEvalKit

Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks

What it solves

VLMEvalKitは、大規模視覚言語モデル(LVLM)を評価するための、統一されたオープンソースのツールキットを提供します。これにより、研究者や開発者が複数の異なるベンチマーク・リポジトリにわたって手動でデータを準備する必要がなくなり、一つのコマンドで様々なベンチマークの評価が可能になります。

How it works

このツールキットは、すべてのモデルに対して生成ベースの評価アプローチを採用しています。精度を決定するために、完全一致(exact matching)とLLMベースの回答抽出の両方をサポートしています。新しいモデルを追加する開発者の場合、単一の generate_inner() 関数を実装するだけで済み、データのダウンロード、前処理、推論、および指標の計算はツールキットが処理します。

Who it’s for

再現可能な方法で標準的なベンチマークを用いてモデルを評価する必要があるAI研究者やVLM開発者向けに設計されています。

Highlights

  • Extensive Support: 200以上の大規模マルチモーダルモデル(LMM)と70以上の画像およびビデオのベンチマークをサポートしています。
  • Distributed Inference: LMDeployやVLLMと連携し、大規模または思考型モデルのより高速な評価を実現するために、マルチノード分散推論をサポートしています。
  • Thinking Mode Support: 思考モードを持つモデルのための特別な処理(<think> タグ内のコンテンツの解析)を含んでいます。
  • Flexible Output: 非常に長い回答を生成するモデルによるデータの切り捨てを防ぐため、予測ファイルをTSV形式で保存することをサポートしています。
  • Broad Compatibility: モデルの互換性を確保するために、transformerstorchvision、および flash-attn の詳細なバージョン推奨事項を提供しています。