vllm-project/vllm-ascend

Community maintained hardware plugin for vLLM on Ascend

해결하는 문제

vLLM 추론 엔진이 Huawei Ascend NPU(Neural Processing Units)에서 원활하게 실행될 수 있도록 합니다. 하드웨어 플러그형 인터페이스를 제공함으로써 Ascend NPU 통합을 vLLM 코어 코드베이스에서 분리하여, 사용자가 메인 엔진을 수정하지 않고도 Ascend 하드웨어에서 고성능 LLM을 배포할 수 있도록 합니다.

작동 방식

이 프로젝트는 커뮤니티에서 유지 관리하는 하드웨어 플러그인 역할을 합니다. 특정 RFC를 기반으로 한 플러그형 인터페이스를 구현하여 vLLM이 Ascend 하드웨어와 통신할 수 있도록 합니다. 이를 통해 CANN 소프트웨어 스택과 PyTorch를 사용하여 Transformer 기반 모델, Mixture-of-Experts (MoE), Embedding 모델 및 멀티모달 LLM을 포함한 다양한 모델 아키텍처를 지원할 수 있습니다.

대상

Ascend NPU 하드웨어(Atlas 800I 또는 Atlas A2/A3 시리즈 등)를 보유하고 있으며, 효율적인 모델 추론 및 배포를 위해 vLLM을 사용하고자 하는 개발자 및 연구자.

주요 특징

  • 폭넓은 모델 지원: Transformer, MoE, Embedding 및 멀티모달 LLM과 호환됩니다.
  • 하드웨어 플러그인 기능: 하드웨어 통합을 vLLM 코어 엔진에서 분리하여 유지 관리가 용이합니다.
  • 엔터프라이즈 하드웨어 지원: Atlas 800I 및 Atlas A2/A3 시리즈 NPU에 최적화되었습니다.
  • 커뮤니티 주도: vLLM의 메인 릴리스 주기와의 호환성을 보장하기 위해 플러그인 형태로 유지 관리됩니다.