ROCm/aiter
AI Tensor Engine for ROCm
解决的问题
AITER(AI Tensor Engine for ROCm)为AMD GPU提供高性能的优化GPU内核库。它解决了框架开发者在无需从零开始编写低级GPU内核的情况下,获得可用于生产环境的、高度优化的AI推理和训练算子的需求。
工作原理
它作为一个统一的算子集合,可集成到各种AI框架中。AITER利用多种内核后端以实现最大性能,包括Triton、可组合内核(CK)和手工调优的汇编(ASM)。它还利用FlyDSL实现特定算子(如GEMM和MoE),并包含一个轻量级C++模板库Opus,以加速HIP内核的开发和构建时间。
适用对象
该库主要面向框架开发者(如vLLM、SGLang或JAX的开发者)以及需要在AMD Instinct和Radeon GPU上优化工作负载的自定义AI推理引擎工程师。
主要亮点
- 广泛的框架支持:作为ROCm上LLM推理的默认内核后端,已集成到vLLM、SGLang和ATOM中。
- 多样化的算子集合:包含针对注意力机制(MHA、MLA、分页注意力)、专家混合(MoE)、GEMM、归一化和量化等的优化内核。
- 多后端方法:结合Triton、CK和手工调优的ASM,针对不同硬件架构进行优化。
- 显著的性能提升:表现出显著的加速效果,例如MLA解码内核最高达17倍,MHA预填充内核最高达14倍。
- 灵活的API:提供C++和Python API,便于集成。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch