NVIDIA/TileGym

Helpful kernel tutorials, examples and SKILLs for tile-based GPU programming

해결하는 문제

TileGym은 CUDA를 사용하여 효율적인 타일 기반 GPU 프로그래밍을 배우고 구현하는 데 도움을 주는 라이브러리입니다. 이론적인 GPU 최적화와 실제 응용 사이의 격차를 메우기 위해, 특히 딥러닝 연산자와 대규모 언어 모델(LLM)을 대상으로 하여 고성능 커널을 실험할 수 있는 플레이그라운드를 제공합니다.

작동 방식

TileGym은 여러 백엔드에 걸쳐 사전 구현된 CUDA Tile 커널을 제공하여 사용자가 구현을 교체해 성능과 동작을 비교할 수 있도록 합니다. 지원되는 백엔드로는 cuTile(Python), CUDA Tile C++, Triton CUDA Tile IR, 그리고 실험적인 Rust 기반 백엔드(cuTile-rs)가 있습니다.

대상 사용자

NVIDIA Blackwell 및 Ampere 아키텍처를 사용하는 딥러닝 모델의 성능을 최적화하고자 하는 GPU 커널 개발자, AI 연구자, 소프트웨어 엔지니어를 위한 것입니다.

주요 특징

  • 다중 백엔드 지원: cuTile, C++, Triton, Rust에서의 구현 제공.
  • LLM 통합: Llama 3.1 및 DeepSeek V2와 같은 모델에 이러한 커널을 통합하는 엔드투엔드 예제 포함.
  • 성능 도구: 커널 효율성을 평가하기 위한 내장 벤치마킹 도구.
  • 하드웨어 최적화: NVIDIA Blackwell 및 Ampere GPU에서 특별히 검증됨.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트