tensorgi/TPA

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.org/abs/2501.06425)

何を解決するか

TPA(Tensor ProducT ATTenTion)は、標準的なTransformerモデルの効率性とパフォーマンスのボトルネックを解決します。特に、推論中に主なメモリボトルネックとなるKV(Key-Value)キャッシュのサイズを削減しながら、モデルのパフォーマンスを向上させることを目的としています。

仕組み

このプロジェクトは、標準的なアテンション機構をTensor Product Attentionに置き換えるT6アーキテクチャを実装しています。生成プロセスを最適化する専用のデコーディングアルゴリズムであるFlashTPAも含まれています。実装はnanoGPTコードベースに基づいており、PyTorchを用いた複数GPUでの分散学習をサポートしています。

対象ユーザー

Transformerアーキテクチャの研究・開発に従事する研究者や開発者。特に、アテンション機構の改善とLLM推論時のメモリオーバーヘッドの削減に注力している人向けです。

特徴

  • Tensor Product Attention: より高いパフォーマンスと効率性を実現するための新しいアテンション機構。
  • FlashTPAデコーディング: より高速かつメモリ効率の良いデコーディングを実現する最適化されたPythonおよびTriton実装。
  • スケーラビリティ: Fineweb-Edu-100BやOpenWebTextなどの大規模データセットに最適化されています。
  • 標準化された評価: パフォーマンスのベンチマークにlm-evaluation-harnessを統合しています。

これは、Transformerモデルのアーキテクチャの進化において、メモリ効率とパフォーマンスの両立を実現する重要な一歩です。— @username

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト