modelscope/evalscope
A streamlined and customizable framework for efficient large model (LLM, VLM, AIGC) evaluation and performance benchmarking.
解决的问题
EvalScope 是一个旨在简化大语言模型 (LLM) 及其他 AI 模型评估的综合框架。它提供了一个统一的接口来衡量模型能力、测试压力下的推理性能并实现结果可视化,从而消除了运行多个不同评估工具的必要性。
工作原理
EvalScope 作为一个一站式评估中心,集成了多个后端(如 OpenCompass、VLMEvalKit 和 RAGEval)以及大量的行业标准基准测试库(如 MMLU、C-Eval 和 GSM8K)。它支持通过 OpenAI 兼容的 API 或本地模型文件来评估模型。对于高级用例,它包含一个“Agent Evaluation Mode”,可以在 Docker 沙箱和可插拔策略的控制下,在受控的多轮循环中运行基准测试。它还包含一个性能测试模块,用于测量首字延迟 (TTFT) 和单字输出耗时 (TPOT) 等指标。
适用对象
该工具适用于需要标准化其评估流水线、跨不同领域比较不同模型,或对其模型服务进行生产就绪压力测试的 AI 开发人员、研究人员和模型提供商。
亮点
- 广泛的模型支持:评估 LLM、视觉语言模型 (VLM)、Embeddings、Rerankers 和 AIGC 模型。
- 智能体评估 (Agentic Evaluation):支持针对 SWE-bench 等基准测试的多轮智能体循环,并提供完整的追踪记录和可视化。
- uma Arena 模式:实现模型之间的两两对战,从而直观地对模型进行排名。
- 性能压力测试:测量模型服务的推理效率和吞吐量。
- 交互式仪表板:基于 React 的 WebUI,用于多维度模型比较和详细的预测检查。
- 可扩展架构:允许开发人员轻松添加自定义数据集、模型和指标。