accel-sim/accel-sim-framework
This is the top-level repository for the Accel-Sim framework.
何を解決するか
Accel-Sim は、NVIDIA GPUの高性能な性能モデリングを提供するサイクルレベルGPUシミュレータです。実際のハードウェアをすべてのアーキテクチャ実験やパフォーマンス分析に必要としなくてもよいという問題を解決し、開発者や研究者が最新のワークロード(LLM推論および学習を含む)を、実際のシリコンに非常に高い忠実度でシミュレートできるようにします。
動作方法
このフレームワークはトレース駆動型アプローチを使用しています。まず、NVBitベースのトレーサーを使ってNVIDIAハードウェアから実際のSASS(シェーダアセンブリ)実行をキャプチャします。これらのトレースは、詳細なパフォーマンスモデル(GPGPU-Sim 4.x)とAccelWattch電力モデルを組み合わせた上で再実行されます。
Accel-Sim 2.0は特にNVIDIA Hopperアーキテクチャ(H100/H200)のサポートを追加しており、Tensor Memory Accelerator(TMA)、非同期Warp Group MMA(WGMMA)、スレッドブロッククラスタなどの複雑な機能をモデル化しています。LLM向けには、vLLM内の特定の代表的なレイヤー(例:vLLM内)をトレースするためのPyTorchフックを提供しており、全モデルをトレースする場合に比べて計算コストが非常に高くなることを回避できます。
対象ユーザー
コンピュータアーキテクト、GPU研究者、AIエンジニアの主な対象であり、GPUハードウェアの利用状況、エネルギー消費、アーキテクチャ変更がAIワークロードに与える影響を分析する必要がある人向けです。
特徴
- 高い精度: 実際のH100シリコンと比較して34,000以上のカーネルインスタンスで検証済み。ピアソン相関係数が99%以上。
- 完全なHopper対応: TMA、WGMMA、mbarrier同期などH100/H200固有の機能をモデル化。
- LLM対応: vLLM推論およびPyTorchトレーニングステップのトレースをネイティブにサポート。手書きカーネルの必要なし。
- 電力モデリング: 電力分析用に統合されたAccelWattchおよびGPUWattchモデル。
- 柔軟なトレース: SASSトレース駆動シミュレーションとPTX実行駆動モードの両方をサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト