AISBench/benchmark
AISBench Benchmark is a model evaluation tool built on OpenCompass, compatible with OpenCompass’s configuration system, dataset structure, and model backend implementation, while extending support for service-based models.
해결하는 문제
AISBench Benchmark는 AI 모델의 성능과 정확도를 측정하기 위해 설계된 종합 평가 도구로, vLLM이나 Triton을 통해 배포된 것과 같은 "서비스 기반" (API 기반) 모델에 대한 지원을 확장하는 데 중점을 둡니다. 다양한 모달리티에 걸쳐 모델 품질을 검증하고 실제 워크로드 상에서 추론 서비스를 스트레스 테스트할 수 있는 표준화된 방법의 필요성을 해결합니다.
작동 방식
OpenCompass 프레임워크를 기반으로 구축된 AISBench는 해당 구성 시스템 및 데이터셋 구조와 통합됩니다. 두 가지 주요 평가 모드로 작동합니다:
- 정확도 평가: 광범위한 질의응답 및 추론 벤치마크(텍스트 및 멀티모달 데이터 포함)를 사용하여 로컬 및 서비스 기반 모델의 응답 정확성을 검증합니다.
- 성능 평가: 서비스 기반 모델의 지연 시간과 처리량을 측정하며, 극한 스트레스 테스트, 정상 상태 성능 분석 및 실제 비즈니스 트래픽 패턴 시뮬레이션이 포함됩니다.
사용자는 Python 스크립트나 명령줄 인수를 통해 작업을 구성하여 모델 백엔드, 데이터셋 및 원하는 요약 방법을 지정할 수 있습니다.
대상 사용자
- 모델의 정확도를 산업 표준에 따라 벤치마크해야 하는 AI 엔지니어 및 연구원.
- 추론 서비스의 처리량과 지연 시간 최적화를 담당하는 MLOps 엔지니어.
- 높은 동시성 환경에서 서비스 안정성과 성능을 검증해야 하는 LLM 또는 멀티모달 모델을 배포하는 개발자.
주요 특징
- 폭넓은 벤치마크 지원: SWE-Bench, TAU2-Bench, VBench 및 OneIG-Benchmark를 포함한 수많은 벤치마크를 통합합니다.
- 멀티모달 기능: 텍스트, 이미지 생성(GEdit-Bench) 및 비디오 생성(VBench) 평가를 지원합니다.
- 서비스 지향: 요청 속도 제어 및 동시성 관리와 같은 기능을 갖춘 API 기반 모델을 위한 전문 지원을 제공합니다.
- 고급 성능 도구: 실제 트래픽 시뮬레이션 및 정상 상태 성능 테스트를 포함하여 시스템의 진정한 최적 성능을 찾습니다.
- 유연한 배포: PyPI를 통해 Python 패키지로 제공되며, 다중 아키텍처 Docker 이미지(x86_64 및 ARM)로도 제공됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트