flagos-ai/FlagPerf
FlagPerf is an open-source software platform for benchmarking AI chips.
해결하는 문제
FlagPerf는 모델 + 프레임워크 + 컴파일러를 포함한 완전한 소프트웨어 스택 내에서 AI 하드웨어의 실제 능력을 측정하기 위해 설계된 통합형 AI 하드웨어 평가 엔진입니다. 단순한 '완료까지 소요 시간'을 넘어서, 실제 AI 학습 및 추론 시나리오에서 하드웨어가 어떻게 작동하는지를 포괄적이고 산업 중심의 평가를 제공합니다.
작동 방식
FlagPerf는 여러 차원과 환경에서 하드웨어를 평가합니다:
- 다차원 메트릭: 특정 모델을 지원할 수 있는지 여부(기능적 정확성), 성능, 리소스 활용도, 생태계 적응성을 측정합니다.
- 다양한 워크로드: 컴퓨터 비전(CV), 자연어 처리(NLP), 음성, 멀티모달 영역을 아우르는 30개 이상의 전통적 모델과 80개 이상의 학습 예제를 포함하며, 대규모 언어 모델(LLM) 학습 및 추론도 포함됩니다.
- 소프트웨어 통합: PyTorch, TensorFlow, PaddlePaddle, MindSpore 등의 프레임워크와 TensorRT, XTCL, IxRT, TorchInductor 등의 추론 엔진을 지원하여 하드웨어와 소프트웨어 생태계를 연결합니다.
- 확장 가능한 테스트: 단일 카드, 단일 머신(일반적으로 8개 카드), 멀티머신 환경에서 성능을 테스트합니다.
- 공정성 제어: 객관적인 결과를 보장하기 위해, 칩 제조사는 적응을 위해 하드웨어 관련 코드(예: 분산 통신, 배치 크기)만 수정할 수 있으며, 최종 테스트는 베이징 인공지능 연구원(BAAI)이 오픈소스 FlagPerf 플랫폼을 사용하여 수행합니다.
대상 사용자
- AI 하드웨어 제조사: 산업 표준과의 비교를 통해 칩 성능을 벤치마킹하고 소프트웨어 스택 호환성을 검증합니다.
- AI 인프라 엔지니어: 대규모 모델 학습 및 배포를 위한 다양한 하드웨어/소프트웨어 조합의 성능과 안정성을 평가합니다.
- 연구자: AI 가속기의 재현 가능하고 공정한 성능 데이터를 확보합니다.
주요 특징
- 포괄적인 커버리지: Llama 2/3, GPT-3, Mixtral 등 다양한 모델을 지원합니다.
- 다중 프레임워크 지원: 국내외 여러 학습 프레임워크와 추론 엔진을 통합합니다.
- 다중 규모 평가: 단일 칩부터 멀티노드 클러스터까지 성능을 검증합니다.
- 투명한 프로세스: 모든 테스트 코드가 오픈소스이므로, 테스트 프로세스와 데이터가 완전히 재현 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트