sgl-project/sglang-omni

SGLang-Omni is a high-performance serving framework for audio models (TTS, ASR) and unified multimodal models.

解決的問題

SGLang-Omni 為多模態、語音與語音合成(TTS)模型提供高效率的服務執行環境。它解決了「多階段解碼」的挑戰,即單一請求需要一連串不同的運算模式(例如:前處理、自回歸生成與聲碼器)的組合,而這些模式通常具有不同的資源需求與排程要求。

工作原理

系統將生成過程建模為一系列協調的階段(如編碼器、自回歸引擎、說話者與聲碼器)。它使用階段專用排程,為每個階段匹配工作負載——對自回歸任務使用 SGLang,對串流聲碼器使用輕量級迴圈。控制平面協調請求,而中繼資料平面在共享記憶體、NCCL 與 Mooncake 等不同後端之間傳輸張量資料。

適用對象

專為需要即時、可控制語音生成、音樂生成、音訊轉錄與全模態對話功能的開發者與組織設計。

主要亮點

  • 廣泛模型支援:支援全模態對話模型(Qwen3-Omni)、音樂生成(MiniMax Music 3)、TTS(Higgs Audio v3, MOSS-TTS)與 ASR(Qwen3-ASR)。
  • OpenAI 兼容 API:提供多模態對話、串流語音與音訊轉錄的端點。
  • 多後端硬體支援:支援 NVIDIA CUDA、Apple Silicon(實驗性)與 Intel GPU(實驗性)。
  • SGLang-Omni Router:包含多工作器前端,支援健康檢查、功能發現與生命週期管理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案