sgl-project/sglang-omni
SGLang-Omni is a high-performance serving framework for audio models (TTS, ASR) and unified multimodal models.
解决的问题
SGLang-Omni 为多模态、语音和文本转语音(TTS)模型提供高性能的推理运行时。它解决了"多阶段解码"的挑战,即单个请求需要一系列不同的计算模式(例如,预处理、自回归生成和声码器)的组合,而这些模式通常具有不同的资源需求和调度要求。
工作原理
该系统将生成过程建模为一系列协调的阶段(如编码器、自回归引擎、说话者和声码器)。它使用阶段专用调度,为每个阶段匹配工作负载——对自回归任务使用 SGLang,对流式声码器使用轻量级循环。控制平面协调请求,而中继数据平面在共享内存、NCCL 和 Mooncake 等不同后端之间传输张量数据。
适用对象
专为需要实时、可控语音生成、音乐生成、音频转录和全模态聊天功能的开发者和组织设计。
主要亮点
- 广泛模型支持:支持全模态聊天模型(Qwen3-Omni)、音乐生成(MiniMax Music 3)、TTS(Higgs Audio v3, MOSS-TTS)和 ASR(Qwen3-ASR)。
- OpenAI 兼容 API:提供多模态聊天、流式语音和音频转录的端点。
- 多后端硬件支持:支持 NVIDIA CUDA、Apple Silicon(实验性)和 Intel GPU(实验性)。
- SGLang-Omni Router:包含多工作器前端,支持健康检查、能力发现和生命周期管理。
相关
- 项目
- 项目
- 项目
- 项目
- 项目