vllm-project/vllm-omni
A framework for efficient model inference with omni-modality models
何を解決するか
vLLM-Omniは、元のvLLMフレームワークを拡張し、「any-to-any」マルチモーダルモデルのサービングをサポートします。vLLMは主にテキストベースの自己回帰生成用に設計されていましたが、vLLM-Omniは、テキスト、画像、音声、ビデオ、およびロボットアクションを処理・生成するモデルのサービングを可能にし、自己回帰および非自己回帰(Diffusion Transformersなど)の両方のアーキテクチャをサポートします。
仕組み
このフレームワークは、OmniConnectorと異なるステージ間での動的なリソース割り当てに基づいた、完全に分離されたサービングアーキテクチャを使用します。自己回帰タスクにはvLLMの効率的なKVキャッシュ管理を活用し、パイプライン化されたステージ実行を実装することで、処理のオーバーラップとスループットの向上を実現します。また、tensor、pipeline、data、およびexpert parallelismを通じて、分散推論もサポートします。
対象者
OpenAI互換のAPIサーバーを使用して、TTS、画像/ビデオ/音声生成用の拡散モデル、およびロボットポリシーモデルを含む、高性能なマルチモーダルモデルをデプロイおよびサービングする必要がある開発者や研究者。
ハイライト
- 幅広いモダリティのサポート: テキスト、画像、音声、ビデオ、およびアクションデータを扱います。
- 異種アーキテクチャ: 自己回帰モデルとDiffusion Transformers (DiT) の両方をサポートします。
- リアルタイム機能: ストリーミング音声入出力によるフルデュプレックス(全二重)リアルタイムサービングを提供します。
- 幅広いハードウェア互換性: CUDA、ROCm、XPU、NPU、およびMUSAをサポートします。
- モデル統合: Qwen3-Omni、MiniMax H3、および様々なロボットポリシーモデルのような、人気のHugging Faceモデルとシームレスに統合されます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト