NVIDIA/TileGym

Helpful kernel tutorials, examples and SKILLs for tile-based GPU programming

何を解決するか

TileGym は、CUDA を使用して効率的なタイルベース GPU プログラミングを学び、実装するのを支援するライブラリです。理論的な GPU 最適化と実際の応用の間のギャップを埋めるために、特にディープラーニング演算子および大規模言語モデル(LLM)をターゲットにした、高性能カーネルの実験ができるプレイグラウンドを提供します。

仕組み

TileGym は、複数のバックエンドにわたる事前実装された CUDA Tile カーネルのコレクションを提供し、ユーザーが実装を切り替えてパフォーマンスと挙動を比較できるようにしています。サポートされるバックエンドには cuTile(Python)、CUDA Tile C++、Triton CUDA Tile IR、および実験的な Rust ベースのバックエンド(cuTile-rs)があります。

対象ユーザー

NVIDIA Blackwell および Ampere アーキテクチャを活用してディープラーニングモデルのパフォーマンスを最適化したい GPU カーネル開発者、AI 研究者、ソフトウェアエンジニア向けです。

特徴

  • マルチバックエンド対応:cuTile、C++、Triton、Rust での実装を提供。
  • LLM 統合:Llama 3.1 や DeepSeek V2 などのモデルにこれらのカーネルを統合するエンドツーエンドの例を含む。
  • パフォーマンスツール:カーネル効率を評価するための組み込みベンチマークツール。
  • ハードウェア最適化:NVIDIA Blackwell および Ampere GPU で特に検証済み。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト