open-compass/opencompass
OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.
解决的问题
OpenCompass 提供了一个统一、公平且可复现的平台,用于评估大语言模型(LLMs)和大视觉-语言模型(LVLMs)。它消除了手动运行多个分散的基准测试的需要,提供了一站式系统,可从多个维度评估模型的质量和有效性。
工作原理
OpenCompass 采用模块化设计,允许用户通过 HuggingFace、API 或自定义接口集成各种模型和数据集。它支持零样本、少样本和思维链(Chain-of-Thought)等多种评估范式,并可通过 CLI 或 Python 脚本进行配置。为提高效率,它实现了分布式评估,可处理百亿规模模型,并与 vLLM 和 LMDeploy 等加速后端集成。
适用人群
专为需要将模型与行业标准进行基准测试、比较开源与专有 API 模型,或开发新评估基准的 AI 研究人员和实践者设计。
主要亮点
- 广泛兼容性:支持 20+ 模型和 70+ 数据集,涵盖约 40 万道问题。
- 分布式评估:通过任务拆分,可在数小时内完成大规模评估任务。
- 灵活范式:支持零样本、少样本和 CoT 评估,可自定义提示模板。
- LLM-as-Judge:包含
GenericLLMEvaluator等工具,可使用 LLM 评估其他模型输出。 - 多模态支持:与 VLMEvalKit 集成,原生支持多模态数据集加载与评估。
相关
- 项目
- 项目
- 项目
- 项目
- 项目