AISBench/benchmark
AISBench Benchmark is a model evaluation tool built on OpenCompass, compatible with OpenCompass’s configuration system, dataset structure, and model backend implementation, while extending support for service-based models.
解決的問題
AISBench Benchmark 是一個綜合評估工具,旨在測量 AI 模型的效能與準確度,特別專注於擴展對「服務型」(API 驅動)模型的支援,例如透過 vLLM 或 Triton 部署的模型。它解決了跨不同模態驗證模型品質,以及在真實工作負載下對推論服務進行壓力測試的標準化需求。
運作方式
AISBench 建構於 OpenCompass 框架之上,整合了其設定系統與資料集結構。它主要透過兩種評估模式運作:
- 準確度評估:使用大量的問答與推理基準測試(涵蓋文字與多模態資料),驗證本地與服務型模型回應的正確性。
- 效能評估:測量服務型模型的延遲與吞吐量,包含極限壓力測試、穩態效能分析,以及模擬真實世界的業務流量模式。
使用者可以透過 Python 腳本或命令列參數來設定任務,指定模型後端、資料集以及所需的摘要方法。
適用對象
- AI 工程師與研究員,需要根據業界標準對其模型的準確度進行基準測試。
- MLOps 工程師,負責最佳化推論服務的吞吐量與延遲。
- 開發人員,部署 LLM 或多模態模型,需要驗證服務在高併發下的穩定性與效能。
亮點
- 廣泛的基準測試支援:整合了多個基準測試,包含 SWE-Bench、TAU2-Bench、VBench 和 OneIG-Benchmark。
- 多模態能力:支援評估文字、影像生成(GEdit-Bench)和視訊生成(VBench)。
- 服務導向:為基於 API 的模型提供專門支援,具備請求速率控制和併發管理等功能。
- 進階效能工具:包含真實流量模擬和穩態效能測試,以找出系統的真正最佳效能。
- 靈活部署:透過 PyPI 以 Python 套件提供,並提供多架構的 Docker 映像檔(x86_64 和 ARM)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案