sgl-project/sglang-omni

SGLang-Omni is a high-performance serving framework for audio models (TTS, ASR) and unified multimodal models.

何を解決するか

SGLang-Omni は、マルチモーダル、音声、および音声合成(TTS)モデル向けの高性能なサービングランタイムを提供します。"マルチステージデコード"という課題に対処しており、1つのリクエストが異なる計算パターン(例:前処理、自己回帰生成、ボコーディング)の連鎖を必要とする場合、それらはしばしば異なるリソース要件とスケジューリング要件を持つため、効率的な処理が困難です。

仕組み

システムは生成を、エンコーダ、自己回帰エンジン、トークャー、ボコーダーなどの連携されたステージの連鎖としてモデル化します。各ステージのワークロードに応じて専用のスケジューリングを実行し、自己回帰タスクには SGLang を活用、ストリーミングボコーダーには軽量なループを使用します。制御プレーンがリクエストを調整し、リレー・データプレーンが共有メモリ、NCCL、Mooncake などのさまざまなバックエンド間でテンソルペイロードを移動します。

対象ユーザー

リアルタイムで制御可能な音声生成、音楽生成、音声認識、オムニチャット機能を必要とする開発者および組織向けに設計されています。

主な特徴

  • 広範なモデル対応:オムニチャットモデル(Qwen3-Omni)、音楽生成(MiniMax Music 3)、TTS(Higgs Audio v3、MOSS-TTS)、ASR(Qwen3-ASR)をサポート。
  • OpenAI互換API:マルチモーダルチャット、ストリーミング音声、音声認識用のエンドポイントを提供。
  • マルチバックエンドハードウェア対応:NVIDIA CUDA、Apple Silicon(実験的)、Intel GPU(実験的)をサポート。
  • SGLang-Omni Router:ヘルスチェック、機能発見、ライフサイクル管理に対応するマルチワーカーのフロントドアを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト