AISBench/benchmark
AISBench Benchmark is a model evaluation tool built on OpenCompass, compatible with OpenCompass’s configuration system, dataset structure, and model backend implementation, while extending support for service-based models.
解决的问题
AISBench Benchmark 是一个综合评估工具,旨在测量 AI 模型的性能与准确度,特别专注于扩展对“服务型”(API 驱动)模型的支持,例如通过 vLLM 或 Triton 部署的模型。它解决了跨不同模态验证模型质量,以及在真实工作负载下对推理服务进行压力测试的标准化需求。
工作原理
AISBench 构建于 OpenCompass 框架之上,集成了其配置系统与数据集结构。它主要通过两种评估模式运作:
- 准确度评估:使用大量的问答与推理基准测试(涵盖文本与多模态数据),验证本地与服务型模型响应的正确性。
- 性能评估:测量服务型模型的延迟与吞吐量,包含极限压力测试、稳态性能分析,以及模拟真实世界的业务流量模式。
用户可以通过 Python 脚本或命令行参数来配置任务,指定模型后端、数据集以及所需的摘要方法。
适用对象
- AI 工程师与研究员,需要根据行业标准对其模型的准确度进行基准测试。
- MLOps 工程师,负责优化推理服务的吞吐量与延迟。
- 开发人员,部署 LLM 或多模态模型,需要验证服务在高并发下的稳定性与性能。
亮点
- 广泛的基准测试支持:集成了多个基准测试,包含 SWE-Bench、TAU2-Bench、VBench 和 OneIG-Benchmark。
- 多模态能力:支持评估文本、图像生成(GEdit-Bench)和视频生成(VBench)。
- 服务导向:为基于 API 的模型提供专门支持,具备请求速率控制和并发管理等功能。
- 高级性能工具:包含真实流量模拟和稳态性能测试,以找出系统的真正最佳性能。
- 灵活部署:通过 PyPI 以 Python 包提供,并提供多架构的 Docker 镜像(x86_64 和 ARM)。
相关
- 项目
- 项目
- 项目
- 项目
- 项目