NVIDIA/TileGym
Helpful kernel tutorials, examples and SKILLs for tile-based GPU programming
何を解決するか
TileGym は、CUDA を使用して効率的なタイルベース GPU プログラミングを学び、実装するのを支援するライブラリです。理論的な GPU 最適化と実際の応用の間のギャップを埋めるために、特にディープラーニング演算子および大規模言語モデル(LLM)をターゲットにした、高性能カーネルの実験ができるプレイグラウンドを提供します。
仕組み
TileGym は、複数のバックエンドにわたる事前実装された CUDA Tile カーネルのコレクションを提供し、ユーザーが実装を切り替えてパフォーマンスと挙動を比較できるようにしています。サポートされるバックエンドには cuTile(Python)、CUDA Tile C++、Triton CUDA Tile IR、および実験的な Rust ベースのバックエンド(cuTile-rs)があります。
対象ユーザー
NVIDIA Blackwell および Ampere アーキテクチャを活用してディープラーニングモデルのパフォーマンスを最適化したい GPU カーネル開発者、AI 研究者、ソフトウェアエンジニア向けです。
特徴
- マルチバックエンド対応:cuTile、C++、Triton、Rust での実装を提供。
- LLM 統合:Llama 3.1 や DeepSeek V2 などのモデルにこれらのカーネルを統合するエンドツーエンドの例を含む。
- パフォーマンスツール:カーネル効率を評価するための組み込みベンチマークツール。
- ハードウェア最適化:NVIDIA Blackwell および Ampere GPU で特に検証済み。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト