vllm-project/vllm-omni

A framework for efficient model inference with omni-modality models

它解決的問題

vLLM-Omni 將原始的 vLLM 框架擴展,以支援「任意對任意」的多模態模型服務。雖然 vLLM 最初是為基於文字的自回歸生成而設計,但 vLLM-Omni 可以服務處理和生成文字、影像、音訊、影片以及機器人動作的模型,支援自回歸與非自回歸(例如 Diffusion Transformers)架構。

如何運作

該框架使用完全解耦的服務架構,基於 OmniConnector 和跨不同階段的動態資源配置。它利用 vLLM 的高效 KV 快取管理來處理自回歸任務,並實現流水線階段執行,以重疊處理流程並提升吞吐量。同時也支援透過張量、流水線、資料和專家平行處理的分散式推論。

適用對象

需要部署和服務高效率多模態模型的開發者與研究人員,包括 TTS、用於影像/影片/音訊生成的擴散模型,以及機器人策略模型,並使用 OpenAI 兼容的 API 伺服器。

主要特色

  • 廣泛的模態支援:處理文字、影像、音訊、影片和動作資料。
  • 異構架構支援:支援自回歸模型與 Diffusion Transformers (DiT)。
  • 即時能力:提供全雙工即時服務,支援串流音訊輸入與輸出。
  • 廣泛的硬體相容性:支援 CUDA、ROCm、XPU、NPU 和 MUSA。
  • 模型整合:可與流行的 Hugging Face 模型無縫整合,例如 Qwen3-Omni、MiniMax H3 和各種機器人策略模型。

"This framework enables seamless deployment of multimodal models across diverse hardware platforms, making it a game-changer for real-time AI applications." — @jamesliu

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案