open-compass/opencompass

OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.

解决的问题

OpenCompass 提供了一个统一、公平且可复现的平台,用于评估大语言模型(LLMs)和大视觉-语言模型(LVLMs)。它消除了手动运行多个分散的基准测试的需要,提供了一站式系统,可从多个维度评估模型的质量和有效性。

工作原理

OpenCompass 采用模块化设计,允许用户通过 HuggingFace、API 或自定义接口集成各种模型和数据集。它支持零样本、少样本和思维链(Chain-of-Thought)等多种评估范式,并可通过 CLI 或 Python 脚本进行配置。为提高效率,它实现了分布式评估,可处理百亿规模模型,并与 vLLM 和 LMDeploy 等加速后端集成。

适用人群

专为需要将模型与行业标准进行基准测试、比较开源与专有 API 模型,或开发新评估基准的 AI 研究人员和实践者设计。

主要亮点

  • 广泛兼容性:支持 20+ 模型和 70+ 数据集,涵盖约 40 万道问题。
  • 分布式评估:通过任务拆分,可在数小时内完成大规模评估任务。
  • 灵活范式:支持零样本、少样本和 CoT 评估,可自定义提示模板。
  • LLM-as-Judge:包含 GenericLLMEvaluator 等工具,可使用 LLM 评估其他模型输出。
  • 多模态支持:与 VLMEvalKit 集成,原生支持多模态数据集加载与评估。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目