open-compass/opencompass
OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.
解決的問題
OpenCompass 提供一個統一、公平且可重現的平台,用於評估大語言模型(LLMs)與大視覺-語言模型(LVLMs)。它消除了手動執行多個分散基準測試的需求,提供一站式的系統,可從多個維度評估模型的品質與效能。
工作原理
OpenCompass 採用模組化設計,允許使用者透過 HuggingFace、API 或自訂介面整合各種模型與資料集。支援零樣本、少樣本與思考鏈(Chain-of-Thought)等多種評估範式,並可透過 CLI 或 Python 腳本進行設定。為提升效率,實作了分散式評估,可處理百億規模模型,並與 vLLM 和 LMDeploy 等加速後端整合。
適用對象
專為需要將模型與產業標準進行基準測試、比較開源與專有 API 模型,或開發新評估基準的 AI 研究人員與實務者設計。
主要亮點
- 廣泛相容性:支援 20+ 模型與 70+ 資料集,涵蓋約 40 萬道問題。
- 分散式評估:透過任務拆分,可在數小時內完成大規模評估任務。
- 靈活範式:支援零樣本、少樣本與 CoT 評估,可自訂提示範本。
- LLM-as-Judge:包含
GenericLLMEvaluator等工具,可使用 LLM 評估其他模型輸出。 - 多模態支援:與 VLMEvalKit 整合,原生支援多模態資料集載入與評估。
相關
- 專案
- 專案
- 專案
- 專案
- 專案