vllm-project/vllm-ascend
Community maintained hardware plugin for vLLM on Ascend
解決する課題
Huawei Ascend NPU(Neural Processing Units)上でvLLM推論エンジンをシームレスに実行できるようにします。ハードウェアプラグイン可能なインターフェースを提供することで、Ascend NPUの統合をvLLMのコアコードベースから分離し、メインエンジンを修正することなく、ユーザーがAscendハードウェア上で高性能なLLMをデプロイできるようにします。
仕組み
このプロジェクトは、コミュニティによって維持されるハードウェアプラグインとして機能します。特定のRFCに基づいたプラグイン可能なインターフェースを実装しており、これによりvLLMがAscendハードウェアと通信できるようになります。これにより、CANNソフトウェアスタックとPyTorchを使用して、Transformer系モデル、Mixture-of-Experts (MoE)、Embeddingモデル、マルチモーダルLLMを含む様々なモデルアーキテクチャのサポートを可能にします。
対象者
Ascend NPUハードウェア(Atlas 800IやAtlas A2/A3シリーズなど)を利用可能で、効率的なモデル推論とデプロイのためにvLLMを使用したい開発者および研究者。
ハイライト
- 幅広いモデルサポート: Transformer、MoE、Embedding、およびマルチモーダルLLMに対応。
- ハードウェアのプラグイン可能性: ハードウェア統合をvLLMコアエンジンから分離し、メンテナンスを容易にします。
- エンタープライズハードウェアのサポート: Atlas 800IおよびAtlas A2/A3シリーズのNPU向けに特別に最適化されています。
- コミュニティ主導: vLLMのメインリリースサイクルとの互換性を確保するため、プラグインとして維持されています。