vllm-project/vllm-omni

A framework for efficient model inference with omni-modality models

何を解決するか

vLLM-Omniは、元のvLLMフレームワークを拡張し、「any-to-any」マルチモーダルモデルのサービングをサポートします。vLLMは主にテキストベースの自己回帰生成用に設計されていましたが、vLLM-Omniは、テキスト、画像、音声、ビデオ、およびロボットアクションを処理・生成するモデルのサービングを可能にし、自己回帰および非自己回帰(Diffusion Transformersなど)の両方のアーキテクチャをサポートします。

仕組み

このフレームワークは、OmniConnectorと異なるステージ間での動的なリソース割り当てに基づいた、完全に分離されたサービングアーキテクチャを使用します。自己回帰タスクにはvLLMの効率的なKVキャッシュ管理を活用し、パイプライン化されたステージ実行を実装することで、処理のオーバーラップとスループットの向上を実現します。また、tensor、pipeline、data、およびexpert parallelismを通じて、分散推論もサポートします。

対象者

OpenAI互換のAPIサーバーを使用して、TTS、画像/ビデオ/音声生成用の拡散モデル、およびロボットポリシーモデルを含む、高性能なマルチモーダルモデルをデプロイおよびサービングする必要がある開発者や研究者。

ハイライト

  • 幅広いモダリティのサポート: テキスト、画像、音声、ビデオ、およびアクションデータを扱います。
  • 異種アーキテクチャ: 自己回帰モデルとDiffusion Transformers (DiT) の両方をサポートします。
  • リアルタイム機能: ストリーミング音声入出力によるフルデュプレックス(全二重)リアルタイムサービングを提供します。
  • 幅広いハードウェア互換性: CUDA、ROCm、XPU、NPU、およびMUSAをサポートします。
  • モデル統合: Qwen3-Omni、MiniMax H3、および様々なロボットポリシーモデルのような、人気のHugging Faceモデルとシームレスに統合されます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト