modelscope/evalscope

A streamlined and customizable framework for efficient large model (LLM, VLM, AIGC) evaluation and performance benchmarking.

EvalScope – LLM和多模態模型的一站式評估平台

簡介 – EvalScope是一個Python套件,可讓您對大型語言模型、視覺語言模型、嵌入/重排序服務甚至自主代理執行各種基準測試。透過單一CLI指令(或幾行Python程式碼),您可以:

  • 評估模型能力 – 執行MMLU、C-Eval、GSM8K、ARC等經典文字基準測試,以及數十個較新的多模態、程式碼生成、RAG和代理中心套件。
  • 壓力測試推論 – 在模型處理請求時測量延遲、首個令牌時間、吞吐量等效能指標。
  • 執行代理 – 將基準測試包裝在多輪AgentLoop中,該迴圈可以呼叫工具(bash、python、網路搜尋、Docker沙箱等),並為每個樣本記錄完整軌跡。
  • 比較模型 – 互動式Web儀表板視覺化分數、逐樣本預測和效能指標,支援成對「競技場」對戰。
  • 外掛式擴充 – 您可以透過幾行設定新增自己的資料集、模型、指標或後端(OpenCompass、VLMEvalKit、RAGEval等)。

核心功能(如README中所列)

功能 提供內容
全面基準測試 內建支援數十個業界標準套件(MMLU、C-Eval、GSM8K、MathVista、VQA、程式碼基準、RAG、代理基準等)。
多模態與多領域 適用於純LLM、視覺語言模型、嵌入服務、重排序器和生成式AIGC模型。
多後端整合 無需編寫膠水程式碼即可呼叫OpenCompass、VLMEvalKit、RAGEval和其他第三方評估器。
代理評估模式 在具有可插拔策略、工具和Docker沙箱的可控AgentLoop中執行基準測試,並記錄詳細的agent_trace
推論效能測試 報告TTFT、TPOT、吞吐量並可模擬多輪對話的壓力測試工具。
互動式Web儀表板 用於模型比較、分數表、逐樣本預測和代理軌跡視覺化的React/Vite UI。
競技場模式 多個模型之間的成對戰,自動排名。
可擴充性 透過簡單的註冊API新增自訂資料集、模型、指標甚至整個新後端。

典型工作流程(快速入門)

# 安裝套件
pip install evalscope

# 評估遠端OpenAI相容API(無需GPU)
# – 選擇GSM8K和ARC基準測試,每個執行5個範例

evalscope eval \
  --model your-model-name \
  --api-url $OPENAI_API_BASE_URL \
  --api-key $OPENAI_API_KEY \
  --eval-type openai_api \
  --datasets gsm8k arc \
  --limit 5

或者,從Python:

from evalscope import run_task, TaskConfig

cfg = TaskConfig(
    model='your-model-name',
    api_url='https://my-endpoint/v1',
    api_key='my_key',
    eval_type='openai_api',
    datasets=['gsm8k', 'arc'],
    limit=5,
)
run_task(cfg)   # 與CLI相同

該指令聯絡模型服務,執行選定的基準測試,收集準確率分數效能資料,最後啟動一個本地Web UI,您可以在其中探索結果。


誰可能使用EvalScope?

  • 模型開發者 – 快速將新LLM或VLM與數十個公共資料集進行基準測試,並檢視其不足之處。
  • 營運/平台團隊 – 對模型服務端點執行壓力測試,以驗證延遲和吞吐量SLA。
  • 研究實驗室 – 使用內建的多輪迴圈評估代理行為(工具呼叫、ReAct、程式碼生成),並記錄軌跡以供分析。
  • 產品團隊 – 在儀表板中並排比較多個候選模型,以做出資料驅動的選擇。

安裝與文件


總結 – EvalScope是一個成熟、積極維護的評估框架,涵蓋廣泛AI模型的準確性、速度和代理能力,全部封裝在使用者友善的CLI和視覺化儀表板中。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案