tensorgi/TPA
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.org/abs/2501.06425)
何を解決するか
TPA(Tensor ProducT ATTenTion)は、標準的なTransformerモデルの効率性とパフォーマンスのボトルネックを解決します。特に、推論中に主なメモリボトルネックとなるKV(Key-Value)キャッシュのサイズを削減しながら、モデルのパフォーマンスを向上させることを目的としています。
仕組み
このプロジェクトは、標準的なアテンション機構をTensor Product Attentionに置き換えるT6アーキテクチャを実装しています。生成プロセスを最適化する専用のデコーディングアルゴリズムであるFlashTPAも含まれています。実装はnanoGPTコードベースに基づいており、PyTorchを用いた複数GPUでの分散学習をサポートしています。
対象ユーザー
Transformerアーキテクチャの研究・開発に従事する研究者や開発者。特に、アテンション機構の改善とLLM推論時のメモリオーバーヘッドの削減に注力している人向けです。
特徴
- Tensor Product Attention: より高いパフォーマンスと効率性を実現するための新しいアテンション機構。
- FlashTPAデコーディング: より高速かつメモリ効率の良いデコーディングを実現する最適化されたPythonおよびTriton実装。
- スケーラビリティ: Fineweb-Edu-100BやOpenWebTextなどの大規模データセットに最適化されています。
- 標準化された評価: パフォーマンスのベンチマークに
lm-evaluation-harnessを統合しています。
これは、Transformerモデルのアーキテクチャの進化において、メモリ効率とパフォーマンスの両立を実現する重要な一歩です。— @username
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト