tensorgi/TPA

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.org/abs/2501.06425)

解決的問題

TPA(Tensor ProducT ATTenTion)解決了標準變壓器模型的效率和性能瓶頸。具體而言,它旨在提升模型性能的同時,減少 KV(Key-Value)快取的大小,這是在推論過程中的主要記憶體瓶頸。

工作原理

該專案實現了 T6 架構,以張量積注意力(Tensor Product Attention)取代標準的注意力機制。它包含一種稱為 FlashTPA 的專用解碼演算法,用於優化生成過程。此實作基於 nanoGPT 程式碼庫,並使用 PyTorch 支援跨多個 GPU 的分散式訓練。

適用對象

致力於變壓器架構的研究人員和開發者,特別是那些專注於改進注意力機制並降低大型語言模型(LLM)推論期間記憶體負載的人。

主要特色

  • 張量積注意力(Tensor Product Attention): 一種新穎的注意力機制,旨在實現更好的性能和效率。
  • FlashTPA 解碼: 經優化的 Python 與 Triton 實作,可實現更快且更節省記憶體的解碼。
  • 可擴展性: 對大型資料集(如 Fineweb-Edu-100B 和 OpenWebText)進行優化。
  • 標準化評估: 已整合至 lm-evaluation-harness,用於性能基準測試。

"This is a significant step toward efficient and scalable LLM inference." — @jx123456789

相關

  • 專案
  • 專案
  • 專案
  • 專案