sgl-project/sglang-omni

SGLang-Omni is a high-performance serving framework for audio models (TTS, ASR) and unified multimodal models.

解决的问题

SGLang-Omni 为多模态、语音和文本转语音(TTS)模型提供高性能的推理运行时。它解决了"多阶段解码"的挑战,即单个请求需要一系列不同的计算模式(例如,预处理、自回归生成和声码器)的组合,而这些模式通常具有不同的资源需求和调度要求。

工作原理

该系统将生成过程建模为一系列协调的阶段(如编码器、自回归引擎、说话者和声码器)。它使用阶段专用调度,为每个阶段匹配工作负载——对自回归任务使用 SGLang,对流式声码器使用轻量级循环。控制平面协调请求,而中继数据平面在共享内存、NCCL 和 Mooncake 等不同后端之间传输张量数据。

适用对象

专为需要实时、可控语音生成、音乐生成、音频转录和全模态聊天功能的开发者和组织设计。

主要亮点

  • 广泛模型支持:支持全模态聊天模型(Qwen3-Omni)、音乐生成(MiniMax Music 3)、TTS(Higgs Audio v3, MOSS-TTS)和 ASR(Qwen3-ASR)。
  • OpenAI 兼容 API:提供多模态聊天、流式语音和音频转录的端点。
  • 多后端硬件支持:支持 NVIDIA CUDA、Apple Silicon(实验性)和 Intel GPU(实验性)。
  • SGLang-Omni Router:包含多工作器前端,支持健康检查、能力发现和生命周期管理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目