flagos-ai/FlagPerf

FlagPerf is an open-source software platform for benchmarking AI chips.

解決的問題

FlagPerf 是一個整合型 AI 硬體評估引擎,旨在衡量 AI 硬體在完整軟體堆疊(模型 + 框架 + 編譯器)內的實際能力。它超越了單純的「完成時間」指標,提供全面且產業導向的評估,以衡量硬體在真實 AI 訓練與推論情境中的表現。

如何運作

FlagPerf 從多個維度與環境中評估硬體:

  • 多維度指標: 測量功能正確性(晶片是否支援特定模型)、效能、資源使用率與生態系適應性。
  • 多樣化工作負載: 包含超過 30 個經典模型與 80 個訓練範例,涵蓋電腦視覺(CV)、自然語言處理(NLP)、語音與多模態領域,包含大型語言模型(LLM)的訓練與推論。
  • 軟體整合: 透過支援 PyTorch、TensorFlow、PaddlePaddle、MindSpore 等框架,以及 TensorRT、XTCL、IxRT、TorchInductor 等推論引擎,將硬體與軟體生態系連結起來。
  • 可擴展測試: 在單卡、單機(通常為 8 張卡)與多機環境中測試效能。
  • 公平性控制: 為確保客觀結果,晶片廠商僅允許修改與硬體相關的程式碼(如分散式通訊、批次大小)以進行適應,最終測試由北京人工智慧研究院(BAAI)使用開源的 FlagPerf 平台執行。

適用對象

  • AI 硬體廠商: 對其晶片進行產業標準對比基準測試,並驗證軟體堆疊相容性。
  • AI 基礎設施工程師: 評估不同硬體/軟體組合在訓練與部署大型模型時的效能與穩定性。
  • 研究人員: 取得可重現且公平的 AI 加速器效能資料。

亮點

  • 全面覆蓋: 支援 Llama 2/3、GPT-3、Mixtral 等多種模型。
  • 跨框架支援: 整合多個國內外訓練框架與推論引擎。
  • 多尺度評估: 從單一晶片到多節點叢集,驗證效能。
  • 透明流程: 所有測試程式碼皆為開源,確保測試流程與資料完全可重現。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案