open-compass/opencompass

OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.

What it solves

OpenCompass 提供一个统一、公平且可重现的平台,用于评估大型语言模型(LLMs)和大型视觉‑语言模型。它通过一站式系统,消除手动管理各种基准测试的复杂性,使用庞大的数据集库在多维度上评估模型质量。

How it works

平台允许用户通过命令行界面(CLI)或 Python 脚本运行评估。它可与多种推理后端(如 HuggingFace、vLLM、LMDeploy)集成,以处理模型执行,并支持零样本、少样本和思考链(CoT)等多种评估范式。平台可同时处理开源模型和基于 API 的模型(如 GPT-4o),互换使用。对于复杂的评估,平台采用模块化设计,支持自定义评估器与顺序评估管线(CascadeEvaluator)。

Who it’s for

此平台面向需要对其 NLP 模型性能进行基准测试、在标准化排行榜上比较不同 LLM,或验证特定模型在推理、知识或长上下文任务上能力的 AI 研究者和工程师。

Highlights

  • Extensive Library: 预先支持超过 20 种模型与 70+ 数据集,约 40 万题目。
  • Distributed Evaluation: 支持一键式分布式任务划分,能够在数小时内评估千亿规模模型。
  • Flexible Inference: 一键切换加速后端,如 vLLM 与 LMDeploy。
  • Diverse Paradigms: 支持零样本、少样本与 CoT 评估,并可自定义提示模板。
  • LLM-as-Judge: 包含 GenericLLMEvaluator 等工具,用 LLM 判断其他模型的输出。