open-compass/opencompass

OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.

What it solves

OpenCompass 提供一個統一、公平且可重現的平臺,用於評估大型語言模型(LLMs)與大型視覺‑語言模型。它透過一站式系統,消除手動管理各種基準測試的複雜性,使用龐大的資料集庫在多維度上評估模型品質。

How it works

平台允許使用者透過指令列介面(CLI)或 Python 腳本執行評估。它可與多種推論後端(如 HuggingFace、vLLM、LMDeploy)整合,以處理模型執行,並支援零樣本、少樣本與思考鏈(CoT)等多種評估範式。平台可同時處理開源模型與基於 API 的模型(如 GPT-4o),互換使用。對於複雜的評估,平台採用模組化設計,支援自訂評估器與串列評估管線(CascadeEvaluator)。

Who it’s for

此平台設計給需要對其 NLP 模型效能進行基準測試、在標準化排行榜上比較不同 LLM,或驗證特定模型在推理、知識或長上下文任務上能力的 AI 研究者與工程師。

Highlights

  • Extensive Library: 預先支援超過 20 種模型與 70+ 資料集,約 40 萬題問題。
  • Distributed Evaluation: 支援一鍵式分散式任務切分,能在數小時內評估千億規模模型。
  • Flexible Inference: 一鍵切換加速後端,如 vLLM 與 LMDeploy。
  • Diverse Paradigms: 支援零樣本、少樣本與 CoT 評估,並可自訂提示模板。
  • LLM-as-Judge: 包含 GenericLLMEvaluator 等工具,用 LLM 判斷其他模型的輸出。