ROCm/aiter

AI Tensor Engine for ROCm

해결하는 문제

AITER (AI Tensor Engine for ROCm)는 AMD GPU에 특화된 고성능 최적화 GPU 커널 라이브러리를 제공합니다. 프레임워크 개발자가 AI 추론 및 학습을 위한 생산 환경 대응형으로 고도로 최적화된 연산자를 직접 저수준 GPU 커널을 처음부터 작성하지 않고도 사용할 수 있도록 합니다.

작동 방식

다양한 커널 백엔드를 활용하여 최대 성능을 달성하는 통합된 연산자 집합으로 작동합니다. Triton, Composable Kernel (CK), 수동 최적화된 어셈블리(ASM)를 포함한 여러 백엔드를 사용하며, GEMM 및 MoE와 같은 특정 연산자에는 FlyDSL을 활용하고, HIP 커널 개발 및 빌드 시간을 가속화하기 위한 경량 C++ 템플릿 라이브러리 Opus도 포함합니다.

대상 사용자

이 라이브러리는 vLLM, SGLang, JAX 등의 프레임워크 개발자 및 AMD Instinct 및 Radeon GPU에서 워크로드를 최적화해야 하는 사용자용 맞춤형 AI 추론 엔진을 구축하는 엔지니어를 주요 대상으로 합니다.

주요 특징

  • 광범위한 프레임워크 지원: ROCm에서 LLM 추론의 기본 커널 백엔드로 vLLM, SGLang, ATOM에 통합되어 있습니다.
  • 다양한 연산자 세트: Attention(MHA, MLA, Paged Attention), Mixture-of-Experts(MoE), GEMM, 정규화, 양자화용 최적화 커널을 포함합니다.
  • 다중 백엔드 접근 방식: 다양한 하드웨어 아키텍처에 최적화하기 위해 Triton, CK, 수동 최적화 ASM을 결합합니다.
  • 매우 뛰어난 성능 향상: MLA 디코딩 커널에서 최대 17배, MHA 프리필 커널에서 최대 14배의 성능 향상을 보였습니다.
  • 유연한 API 제공: C++ 및 Python API를 제공하여 통합이 용이합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch