vllm-project/vllm-ascend

Community maintained hardware plugin for vLLM on Ascend

何を解決するか

vLLM推論エンジンがHuawei Ascend NPU上でスムーズに動作できるようにし、ハードウェア統合をvLLMのコアコードベースから分離するためのプラグインインターフェースを提供します。

動作方法

特定のインターフェース(ハードウェアプラグイン可能なRFCに基づく)を実装するハードウェアプラグインとして機能し、vLLMの要件とAscend NPUアーキテクチャの間を橋渡しします。これにより、TransformerベースのLLM、Mixture-of-Experts(MoE)、埋め込みモデル、マルチモーダルLLMなど、さまざまなモデルタイプをAscendハードウェア上で実行できます。

対象ユーザー

Huawei Ascendハードウェア(例:Atlas 800IやAtlas A2/A3シリーズ)を使用し、vLLMフレームワークを使って高性能なLLM推論をデプロイしたい開発者やAIエンジニア。

特徴

  • MoEやマルチモーダルLLMを含む幅広いモデルアーキテクチャをサポート。
  • メインのvLLMプロジェクトを清潔に保つため、ハードウェアプラグイン可能なアーキテクチャに準拠。
  • CANN 9.1.0および特定のPyTorch/TorchNPUバージョンと互換性あり。
  • コミュニティメンテナンスで、さまざまなAtlas NPUシリーズに対応する専用サポートを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト