vllm-project/vllm-omni
A framework for efficient model inference with omni-modality models
What it solves
vLLM-Omni は、元の vLLM フレームワークを拡張して、オムニ・モダリティ・モデルのサービングをサポートするようにしました。vLLM は主にテキストベースの自己回帰生成用に設計されていましたが、vLLM-Omni は、テキスト、画像、音声、ビデオ、およびロボットのアクションを処理・生成するモデルの効率的な推論とサービングを可能にします。
How it works
このフレームワークは、「OmniConnector」に基づいた完全に分離されたアーキテクチャと、モデル・パイプラインの異なるステージにおける動的なリソース割り当てを使用します。vLLM の効率的な KV cache 管理を自己回帰タスクに活用し、パイプライン・ステージ実行のオーバーラップを導入することでスループットを向上させます。また、自己回帰モデルを超えて、Diffusion Transformers (DiT) やその他の並列生成モデルへのサポートを拡張し、ヘテロジニアスな出力を可能にします(例:テキストと画像生成の組み合わせ)。
Who it’s for
TTS、画像/ビデオ生成、およびロボット・ポリシー・モデルを含む、マルチモーダル・モデルのための高性能でプロダクション・レディなサービング・スタックをデプロイする必要がある開発者や研究者。
Highlights
- Broad Modality Support: テキスト、画像、音声、ビデオ、およびアクション・データを処理します。
- Hardware Agnostic: CUDA、ROCm、MUSA、NPU、および XPU バックエンドをサポートします。
- Model Compatibility: Qwen3-Omni、Cosmos3、および FLUX のような人気のある Hugging Face モデルと統合します。
- Distributed Inference: tensor、pipeline、data、および expert parallelism をサポートします。
- Production Ready: OpenAI 互換の API サーバーとストリーミング出力を提供します。