vllm-project/vllm-ascend

Community maintained hardware plugin for vLLM on Ascend

해결하는 문제

vLLM 추론 엔진이 Huawei Ascend NPU에서 원활하게 작동할 수 있도록 하며, 하드웨어 통합을 vLLM의 핵심 코드베이스에서 분리하기 위해 플러그인 인터페이스를 제공합니다.

작동 방식

특정 인터페이스(하드웨어 플러그인 가능한 RFC 기반)를 구현하는 하드웨어 플러그인으로서 vLLM의 요구사항과 Ascend NPU 아키텍처 사이를 연결합니다. 이를 통해 Transformer 기반 LLM, Mixture-of-Experts (MoE), 임베딩 모델, 멀티모달 LLM 등 다양한 모델 유형을 Ascend 하드웨어에서 실행할 수 있습니다.

대상 사용자

Huawei Ascend 하드웨어(예: Atlas 800I 또는 Atlas A2/A3 시리즈)를 사용하고 vLLM 프레임워크를 활용해 고성능 LLM 추론을 배포하고자 하는 개발자 및 AI 엔지니어.

주요 특징

  • MoE 및 멀티모달 LLM을 포함한 다양한 모델 아키텍처 지원.
  • 메인 vLLM 프로젝트를 깨끗하게 유지하기 위해 하드웨어 플러그인 가능한 아키텍처 준수.
  • CANN 9.1.0 및 특정 PyTorch/TorchNPU 버전과 호환.
  • 커뮤니티 유지보수로 다양한 Atlas NPU 시리즈에 대한 전용 지원 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트