vllm-project/vllm-omni

A framework for efficient model inference with omni-modality models

它解决了什么问题

vLLM-Omni 扩展了原始的 vLLM 框架,以支持「任意到任意」的多模态模型服务。虽然 vLLM 主要针对基于文本的自回归生成设计,但 vLLM-Omni 能够服务处理和生成文本、图像、音频、视频以及机器人动作的模型,支持自回归和非自回归(如扩散变换器)架构。

它如何工作

该框架采用完全解耦的服务架构,基于 OmniConnector 和跨不同阶段的动态资源分配。它利用 vLLM 高效的 KV 缓存管理来处理自回归任务,并通过流水线阶段执行来重叠处理过程,提高吞吐量。同时支持通过张量并行、流水线并行、数据并行和专家并行实现分布式推理。

适用于谁

需要部署和提供高性能多模态模型服务的开发者和研究人员,包括 TTS、用于图像/视频/音频生成的扩散模型以及机器人策略模型,均可使用兼容 OpenAI 的 API 服务器。

主要亮点

  • 广泛的模态支持:处理文本、图像、音频、视频和动作数据。
  • 异构架构支持:支持自回归模型和扩散变换器(DiT)。
  • 实时能力:提供全双工实时服务,支持流式音频输入和输出。
  • 广泛的硬件兼容性:支持 CUDA、ROCm、XPU、NPU 和 MUSA。
  • 模型集成:无缝集成流行的 Hugging Face 模型,如 Qwen3-Omni、MiniMax H3 和多种机器人策略模型。

一个真正意义上的多模态推理框架,能够统一处理文本、图像、音频、视频和动作,为下一代 AI 应用提供强大支持。— @handle

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目