yifanzhang-pro/recurrent-looped-tranformer

Official Project Page for Recurrent Looped Transformer (RLT)

What it solves

它解決了標準 Transformer 中固定深度計算的限制,即無論序列長度如何,每個 token 的處理量都是恆定的。Recurrent Looped Transformer (RLT) 旨在提供「無限時間深度」,允許模型隨著序列增長而擴展其計算路徑,旨在提升潛在推理能力。

How it works

RLT 使用結合了因果編碼器與遞歸解碼器的混合架構:

  • Causal Encoder: 建立輸入的全局鍵值 (KV) 記憶。
  • Recurrent Decoder: 將此全局記憶與用於局部上下文的滑動窗口注意力 (SWA) 以及一個反饋迴路結合起來,其中前一個 token 的最終隱藏狀態會被反饋到下一個 token 的處理中。
  • Unified Execution: 模型在預訓練、監督式微調 (SFT) 和 RL replay 中使用相同的狀態轉移邏輯,確保模型訓練方式與文本生成方式之間的一致性。

Who it’s for

研究人員與開發者,特別是從事 Transformer 架構、遞歸神經網絡與潛在推理研究的人員,希望探索針對長序列的標準注意力機制替代方案。

Highlights

  • Infinite Temporal Depth: 計算路徑隨著序列長度線性增長,同時保持每個 token 的固定塊數。
  • Model-Hardware Co-design: 透過平行編碼器工作與記憶體重用,針對高效能訓練與推理進行了優化。
  • Consistent State Transitions: 消除促使詞 (prompt) 處理與回應生成之間的結構性不匹配。
  • State-Tracking Performance: 在合成狀態追蹤任務上展現了優於標準 Transformer 與 GRU 的準確度,特別是在評估長於訓練序列的序列時。

相關

  • 專案
  • 專案
  • 專案
  • 專案