sgl-project/sglang-omni

SGLang-Omni is a high-performance serving framework for audio models (TTS, ASR) and unified multimodal models.

해결하는 문제

SGLang-Omni는 다중 모달, 음성, 음성 합성(TTS) 모델을 위한 고성능 서빙 런타임을 제공합니다. 하나의 요청이 전처리, 자기회귀 생성, 보코딩 등 서로 다른 계산 패턴의 연속을 요구하는 '다단계 디코딩' 문제를 해결합니다. 이러한 단계는 종종 다른 리소스 요구와 스케줄링 요구를 가지므로 효율적인 처리가 어렵습니다.

작동 방식

시스템은 인코더, 자기회귀 엔진, 토크어, 보코더와 같은 연계된 단계로 생성을 모델링합니다. 각 단계의 워크로드에 맞춰 단계 전용 스케줄링을 사용하여 자기회귀 작업에는 SGLang을 활용하고, 스트리밍 보코더에는 가벼운 루프를 사용합니다. 제어 플레인은 요청을 조정하고, 리레이 데이터 플레인은 공유 메모리, NCCL, Mooncake 등의 다양한 백엔드 간에 텐서 페이로드를 이동시킵니다.

대상 사용자

실시간으로 제어 가능한 음성 생성, 음악 생성, 오디오 전사, 오미챗 기능이 필요한 개발자 및 조직을 위한 것입니다.

주요 특징

  • 광범위한 모델 지원: 오미챗 모델(Qwen3-Omni), 음악 생성(MiniMax Music 3), TTS(Higgs Audio v3, MOSS-TTS), ASR(Qwen3-ASR)를 지원합니다.
  • OpenAI 호환 API: 다중 모달 채팅, 스트리밍 음성, 오디오 전사용 엔드포인트를 제공합니다.
  • 다중 백엔드 하드웨어 지원: NVIDIA CUDA, Apple Silicon(실험적), Intel GPU(실험적)을 지원합니다.
  • SGLang-Omni Router: 건강 상태 점검, 기능 탐지, 라이프사이클 관리를 위한 멀티워커 프론트 도어를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트