vllm-project/vllm-ascend
Community maintained hardware plugin for vLLM on Ascend
何を解決するか
vLLM推論エンジンがHuawei Ascend NPU上でスムーズに動作できるようにし、ハードウェア統合をvLLMのコアコードベースから分離するためのプラグインインターフェースを提供します。
動作方法
特定のインターフェース(ハードウェアプラグイン可能なRFCに基づく)を実装するハードウェアプラグインとして機能し、vLLMの要件とAscend NPUアーキテクチャの間を橋渡しします。これにより、TransformerベースのLLM、Mixture-of-Experts(MoE)、埋め込みモデル、マルチモーダルLLMなど、さまざまなモデルタイプをAscendハードウェア上で実行できます。
対象ユーザー
Huawei Ascendハードウェア(例:Atlas 800IやAtlas A2/A3シリーズ)を使用し、vLLMフレームワークを使って高性能なLLM推論をデプロイしたい開発者やAIエンジニア。
特徴
- MoEやマルチモーダルLLMを含む幅広いモデルアーキテクチャをサポート。
- メインのvLLMプロジェクトを清潔に保つため、ハードウェアプラグイン可能なアーキテクチャに準拠。
- CANN 9.1.0および特定のPyTorch/TorchNPUバージョンと互換性あり。
- コミュニティメンテナンスで、さまざまなAtlas NPUシリーズに対応する専用サポートを提供。
関連
- プロジェクト
baidu/vLLM-KunlunA hardware plugin that enables vLLM to run on Kunlun XPU, providing optimized kernels and support for a wide range of LLMs and multimodal models.
- プロジェクト
guqiong96/LvllmvLLMの拡張であり、MoEモデルのVRAMとシステムメモリを横断するハイブリッドGPUおよびNUMA対応CPU推論を可能にし、メモリ使用量を最適化します。
- プロジェクト
ztxz16/fastllmGPU、CPU、NUMA、ディスク間でDenseおよびMoEモデルのハイブリッドデプロイを可能にし、ハードウェア利用率を最大化する高性能なC++ LLM推論エンジン。
- プロジェクト
xLLM-AI/xllmxLLMは、Ascend、Cambricon、Moore Threadsなど中国発AIアクセラレータ上で高スループット・低遅延のLLMサービングを実現するオープンソースC++推論フレームワークです。brpcベースのサービス層とハードウェア最適化エンジンを分離し、MooncakeによるハイブリッドKVキャッシュ管理を実装。GLM-5.3-FlashやMiniMax-M3などのモデル用に即時デプロイスクリプトを提供。Apache-2.0ライセンスで、JD.comおよび複数の中国大学研究室によって支援されています。
- プロジェクト
UbiquitousLearning/mllmモバイルおよびエッジデバイス向けに最適化された高速で軽量なマルチモーダル LLM 推論エンジン。さまざまな NPU および GPU 上でビジョン・ランゲージモデルの実行を最適化します。