AISBench/benchmark

AISBench Benchmark is a model evaluation tool built on OpenCompass, compatible with OpenCompass’s configuration system, dataset structure, and model backend implementation, while extending support for service-based models.

解決する課題

AISBench Benchmark は、AI モデルのパフォーマンスと精度を測定するために設計された総合評価ツールであり、vLLM や Triton などを介してデプロイされるような「サービスベース」(API 駆動)モデルのサポートを拡張することに特に焦点を当てています。さまざまなモダリティにわたるモデル品質の検証や、現実的なワークロード下での推論サービスのストレステストに対する標準化された手法の必要性を解決します。

仕組み

OpenCompass フレームワークの上に構築された AISBench は、その設定システムとデータセット構造を統合しています。主に 2 つの評価モードで動作します:

  1. 精度評価:幅広い質問応答および推論ベンチマーク(テキストおよびマルチモーダルデータをカバー)を使用して、ローカルモデルとサービスベースモデルの両方の応答の正確性を検証します。
  2. パフォーマンス評価:サービスベースモデルのレイテンシとスループットを測定します。これには、極限のストレステスト、定常状態のパフォーマンス分析、および現実世界のビジネストラフィックパターンのシミュレーションが含まれます。

ユーザーは Python スクリプトまたはコマンドライン引数を介してタスクを設定し、モデルバックエンド、データセット、および目的の要約方法を指定できます。

対象者

  • 業界標準に対してモデルの精度をベンチマークする必要がある AI エンジニアと研究者
  • 推論サービスのスループットとレイテンシの最適化を担当する MLOps エンジニア
  • 高い同時実行性下でのサービスの安定性とパフォーマンスを検証する必要がある、LLM やマルチモーダルモデルをデプロイする 開発者

ハイライト

  • 幅広いベンチマークサポート:SWE-Bench、TAU2-Bench、VBench、OneIG-Benchmark を含む多数のベンチマークを統合。
  • マルチモーダル機能:テキスト、画像生成(GEdit-Bench)、およびビデオ生成(VBench)の評価をサポート。
  • サービス指向:リクエストレート制御や同時実行管理などの機能を備えた、API ベースモデル専用のサポート。
  • 高度なパフォーマンスツール:現実世界のトラフィックシミュレーションと定常状態のパフォーマンステストを含み、システムの真の最適パフォーマンスを見つけます。
  • 柔軟なデプロイ:PyPI を介して Python パッケージとして提供され、マルチアーキテクチャの Docker イメージ(x86_64 および ARM)としても提供されます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト