modelscope/evalscope

A streamlined and customizable framework for efficient large model (LLM, VLM, AIGC) evaluation and performance benchmarking.

解決的問題

EvalScope 是一個旨在簡化大型語言模型 (LLM) 及其他 AI 模型評估的綜合框架。它提供了一個統一的介面來衡量模型能力、測試壓力下的推理性能並實現結果視覺化,從而消除了執行多個不同評估工具的必要性。

工作原理

EvalScope 作為一個一站式評估中心,集成了多個後端(如 OpenCompass、VLMEvalKit 和 RAGEval)以及大量的產業標準基準測試庫(如 MMLU、C-Eval 和 GSM8K)。它支援透過 OpenAI 相容的 API 或本地模型檔案來評估模型。對於進階用例,它包含一個「Agent Evaluation Mode」,可以在 Docker 沙箱和可插拔策略的控制下,在受控的多輪循環中執行基準測試。它還包含一個效能測試模組,用於測量首字延遲 (TTFT) 和單字輸出耗時 (TPOT) 等指標。

適用對象

該工具適用於需要標準化其評估流水線、跨不同領域比較不同模型,或對其模型服務進行生產就緒壓力測試的 AI 開發人員、研究人員和模型提供商。

亮點

  • 廣泛的模型支援:評估 LLM、視覺語言模型 (VLM)、Embeddings、Rerankers 和 AIGC 模型。
  • 智能體評估 (Agentic Evaluation):支援針對 SWE-bench 等基準測試的多輪智能體循環,並提供完整的追蹤記錄與視覺化。
  • uma Arena 模式:實現模型之間的兩兩對戰,從而直觀地對模型進行排名。
  • 效能壓力測試:測量模型服務的推理效率和吞吐量。
  • 互動式儀表板:基於 React 的 WebUI,用於多維度模型比較和詳細的預測檢查。
  • 可擴展架構:允許開發人員輕鬆添加自定義數據集、模型和指標。