yifanzhang-pro/recurrent-looped-tranformer
Official Project Page for Recurrent Looped Transformer (RLT)
What it solves
它解決了標準 Transformer 中固定深度計算的限制,即無論序列長度如何,每個 token 的處理量都是恆定的。Recurrent Looped Transformer (RLT) 旨在提供「無限時間深度」,允許模型隨著序列增長而擴展其計算路徑,旨在提升潛在推理能力。
How it works
RLT 使用結合了因果編碼器與遞歸解碼器的混合架構:
- Causal Encoder: 建立輸入的全局鍵值 (KV) 記憶。
- Recurrent Decoder: 將此全局記憶與用於局部上下文的滑動窗口注意力 (SWA) 以及一個反饋迴路結合起來,其中前一個 token 的最終隱藏狀態會被反饋到下一個 token 的處理中。
- Unified Execution: 模型在預訓練、監督式微調 (SFT) 和 RL replay 中使用相同的狀態轉移邏輯,確保模型訓練方式與文本生成方式之間的一致性。
Who it’s for
研究人員與開發者,特別是從事 Transformer 架構、遞歸神經網絡與潛在推理研究的人員,希望探索針對長序列的標準注意力機制替代方案。
Highlights
- Infinite Temporal Depth: 計算路徑隨著序列長度線性增長,同時保持每個 token 的固定塊數。
- Model-Hardware Co-design: 透過平行編碼器工作與記憶體重用,針對高效能訓練與推理進行了優化。
- Consistent State Transitions: 消除促使詞 (prompt) 處理與回應生成之間的結構性不匹配。
- State-Tracking Performance: 在合成狀態追蹤任務上展現了優於標準 Transformer 與 GRU 的準確度,特別是在評估長於訓練序列的序列時。
相關
- 專案
- 專案
- 專案
- 專案