flagos-ai/FlagPerf
FlagPerf is an open-source software platform for benchmarking AI chips.
何を解決するか
FlagPerf は、モデル + フレームワーク + コンパイラを含む完全なソフトウェアスタック内で、AIハードウェアの実際の能力を測定する統合型AIハードウェア評価エンジンです。単なる「完了までの時間」にとどまらず、実世界のAIトレーニングおよび推論シナリオにおけるハードウェアのパフォーマンスを、包括的かつ業界志向の評価を提供します。
動作方法
FlagPerf は、複数の次元および環境でハードウェアを評価します:
- 多次元メトリクス: モデルの機能的正しさ(特定のモデルをサポートできるか)、パフォーマンス、リソース利用率、エコシステムへの適応性を測定します。
- 多様なワークロード: コンピュータビジョン(CV)、自然言語処理(NLP)、音声、マルチモーダル領域をカバーする30以上の古典的モデルと80以上のトレーニング例を含み、大規模言語モデル(LLM)のトレーニングおよび推論も対象です。
- ソフトウェア統合: PyTorch、TensorFlow、PaddlePaddle、MindSporeなどのフレームワーク、およびTensorRT、XTCL、IxRT、TorchInductorなどの推論エンジンをサポートすることで、ハードウェアとソフトウェアエコシステムを接続します。
- スケーラブルなテスト: 単一カード、単一マシン(通常8カード)、マルチマシン環境でのパフォーマンスをテストします。
- 公平性の確保: 客観的な結果を保証するため、チップベンダーは適応のためにハードウェア関連コード(例:分散通信、バッチサイズ)のみを変更可能であり、最終的なテストは北京人工知能研究院(BAAI)がオープンソースのFlagPerfプラットフォームを使用して実施します。
対象ユーザー
- AIハードウェアベンダー: 業界標準との比較によるチップベンチマークとソフトウェアスタック互換性の検証。
- AIインフラエンジニア: 大規模モデルのトレーニングおよびデプロイにおいて、異なるハードウェア/ソフトウェア組み合わせのパフォーマンスと安定性を評価。
- 研究者: AIアクセラレータの再現可能で公正なパフォーマンスデータを取得。
特徴
- 包括的なカバー範囲: Llama 2/3、GPT-3、Mixtralなど、幅広いモデルをサポート。
- フレームワーク間対応: 国内外の複数のトレーニングフレームワークおよび推論エンジンを統合。
- 多スケール評価: 単一チップからマルチノードクラスタまで、パフォーマンスを検証。
- 透明性のあるプロセス: すべてのテストコードがオープンソースであり、テストプロセスとデータが完全に再現可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト