NVIDIA/TileGym
Helpful kernel tutorials, examples and SKILLs for tile-based GPU programming
解決的問題
TileGym 是一個旨在幫助開發者學習並實作高效 CUDA 基於 tile 的 GPU 程式設計的函式庫。它透過提供一個實驗高效率內核的沙盒,彌補理論上的 GPU 優化與實際應用之間的差距,特別針對深度學習運算子與大型語言模型(LLMs)。
工作原理
TileGym 提供多個後端的預先實作 CUDA Tile 內核集合,讓使用者可以切換實作來比較效能與行為。支援多種後端,包括 cuTile(Python)、CUDA Tile C++、Triton CUDA Tile IR,以及一個實驗性的 Rust 基底後端(cuTile-rs)。
適用對象
針對希望優化深度學習模型效能的 GPU 內核開發者、AI 研究人員與軟體工程師,特別適用於使用 NVIDIA Blackwell 與 Ampere 架構的場景。
主要亮點
- 多後端支援:提供 cuTile、C++、Triton 與 Rust 的實作。
- LLM 整合:包含端對端範例,展示如何將這些內核整合至 Llama 3.1 與 DeepSeek V2 等模型中。
- 效能工具:內建基準測試工具,用於評估內核效率。
- 硬體最佳化:特別針對 NVIDIA Blackwell 與 Ampere GPU 進行驗證。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案