vllm-project/vllm-ascend

Community maintained hardware plugin for vLLM on Ascend

解決する課題

Huawei Ascend NPU(Neural Processing Units)上でvLLM推論エンジンをシームレスに実行できるようにします。ハードウェアプラグイン可能なインターフェースを提供することで、Ascend NPUの統合をvLLMのコアコードベースから分離し、メインエンジンを修正することなく、ユーザーがAscendハードウェア上で高性能なLLMをデプロイできるようにします。

仕組み

このプロジェクトは、コミュニティによって維持されるハードウェアプラグインとして機能します。特定のRFCに基づいたプラグイン可能なインターフェースを実装しており、これによりvLLMがAscendハードウェアと通信できるようになります。これにより、CANNソフトウェアスタックとPyTorchを使用して、Transformer系モデル、Mixture-of-Experts (MoE)、Embeddingモデル、マルチモーダルLLMを含む様々なモデルアーキテクチャのサポートを可能にします。

対象者

Ascend NPUハードウェア(Atlas 800IやAtlas A2/A3シリーズなど)を利用可能で、効率的なモデル推論とデプロイのためにvLLMを使用したい開発者および研究者。

ハイライト

  • 幅広いモデルサポート: Transformer、MoE、Embedding、およびマルチモーダルLLMに対応。
  • ハードウェアのプラグイン可能性: ハードウェア統合をvLLMコアエンジンから分離し、メンテナンスを容易にします。
  • エンタープライズハードウェアのサポート: Atlas 800IおよびAtlas A2/A3シリーズのNPU向けに特別に最適化されています。
  • コミュニティ主導: vLLMのメインリリースサイクルとの互換性を確保するため、プラグインとして維持されています。