sgl-project/sglang-jax

JAX backend for SGL

解決的問題

SGL-JAX 解決了在 Google TPU 上以高吞吐量與低延遲部署大型語言模型 (LLM) 的挑戰。它提供了一個專門的推理引擎,可為高要求的生產工作負載實現硬體利用率最大化。

工作原理

該引擎採用分散式架構,由相容 OpenAI 的 HTTP 伺服器、用於連續批處理 (continuous batching) 的調度器,以及使用 JAX 執行模型的 Tensor Parallel Workers 組成。它透過以下關鍵機制優化性能:

  • Radix Tree KV Cache: 高效管理記憶體,允許具有共同前綴的請求共享快取數據,從而減少冗餘計算。
  • Continuous Batching: 動態對傳入的請求進行分組,以保持 TPU 的充分利用。
  • FlashAttention: 整合高性能核心,加速長序列的注意力計算。
  • Tensor Parallelism: 將大型模型拆分到多個 TPU 裝置上,以處理超過單個晶片記憶體容量的模型。

適用對象

專為在 Google TPU 硬體上部署大規模 LLM 或多模態模型(如文本轉影片或視覺語言模型)的開發人員與組織設計。

亮點

  • 相容 OpenAI API: 可作為現有基於 OpenAI 的工具與 SDK 的即插即用替代方案。
  • 廣泛的模型支援: 針對 Qwen(包括 MoE 變體)、Llama、Gemma 2、DeepSeek 等進行了優化。
  • 多模態能力: 支援文本轉影片 (Wan 2.1/2.2) 與視覺語言 (Qwen2.5-VL) 模型。
  • 基於 JAX: 從底層構建,專為 TPU 上的高性能執行而設計。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案