ByteDance-Seed/Triton-distributed

Distributed Compiler and Optimized Parallel Kernels

解決的問題

Triton-distributed 解決了開發高度優化、能重疊計算與通訊的分散式內核的困難。它讓程式設計師能建立高效能的內核(例如 Distributed-GEMM),其效能可與手動調校的函式庫競爭,同時保有編譯器方法的彈性。

工作原理

基於 OpenAI Triton,此分散式編譯器提供一組低階原語,使 GPU 之間的資料移動能與計算同時進行。支援多種硬體後端,包括 Nvidia(SM80、SM89、SM90a)與 AMD(CDNA3)GPU,並利用 NVLink、InfiniBand(IB)與 PCIe 等通訊層。

適用對象

專為需要優化大型模型分散式訓練或推論效能的 GPU 內核開發者與 AI 研究人員設計,特別適用於使用張量平行(TP)與專家平行(EP)的使用者。

主要亮點

  • 計算-通訊重疊:專門設計用於透過與計算重疊來隱藏通訊延遲。
  • 廣泛的硬體支援:相容 Nvidia 與 AMD GPU。
  • 高效率:在 AllGather GEMM 與 GEMM ReduceScatter 等運算中,效能可與或優於手動調校的函式庫。
  • 推論加速:已實現顯著加速(例如 Seed-OSS-36B-Instruct 達到 1.33 倍)與低延遲的 AllToAll 實作。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案