ByteDance-Seed/Triton-distributed
Distributed Compiler and Optimized Parallel Kernels
解决的问题
Triton-distributed 解决了开发高度优化的、能够重叠计算与通信的分布式内核的困难。它使程序员能够创建高效的内核(如 Distributed-GEMM),其性能可与手工调优的库相媲美,同时保持基于编译器方法的灵活性。
工作原理
基于 OpenAI Triton,该分布式编译器提供了一组低级原语,使数据在 GPU 之间移动的同时进行计算成为可能。它支持多种硬件后端,包括 Nvidia(SM80、SM89、SM90a)和 AMD(CDNA3)GPU,并利用 NVLink、InfiniBand(IB)和 PCIe 等通信层。
适用人群
专为需要优化大规模模型分布式训练或推理性能的 GPU 内核开发者和 AI 研究人员设计,尤其适用于使用张量并行(TP)和专家并行(EP)的用户。
主要亮点
- 计算-通信重叠:专门设计用于通过与计算重叠来隐藏通信延迟。
- 广泛的硬件支持:兼容 Nvidia 和 AMD GPU。
- 高性能:在 AllGather GEMM 和 GEMM ReduceScatter 等操作中,性能可与或优于手工调优的库。
- 推理加速:已实现显著加速(例如 Seed-OSS-36B-Instruct 达到 1.33 倍)和低延迟的 AllToAll 实现。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目