yifanzhang-pro/recurrent-looped-tranformer
Official Project Page for Recurrent Looped Transformer (RLT)
What it solves
它解决了标准 Transformer 中固定深度计算的限制,即无论序列长度如何,每个 token 的处理量都是恒定的。Recurrent Looped Transformer (RLT) 旨在提供“无限时间深度”,允许模型随着序列增长而扩展其计算路径,以期提升潜在推理能力。
How it works
RLT 使用结合了因果编码器与递归解码器的混合架构:
- Causal Encoder: 构建输入的全局键值 (KV) 记忆。
- Recurrent Decoder: 结合此全局记忆与用于局部上下文的滑动窗口注意力 (SWA),以及一个反馈回路,其中前一个 token 的 的最终隐藏状态被反馈到下一个 token 的处理中。
- Unified Execution: 模型在预训练、监督式微调 (SFT) 和 RL replay 中使用相同的状态转换逻辑,确保模型训练方式与文本生成方式之间的一致性。
Who it’s for
研究人员与开发者,特别是从事 Transformer 架构、递归神经网络与潜在推理研究的人员,希望探索针对长序列的標準注意力机制的替代方案。
Highlights
- Infinite Temporal Depth: 计算路径随着序列长度线性增长,同时保持每个 token 的固定块数。
- Model-Hardware Co-design: 核心在于通过并行编码器工作与内存重用,针对高效训练与推理进行优化。
- Consistent State Transitions: 消除提示词 (prompt) 处理与响应生成之间的结构结构性不匹配。
- State-Tracking Performance: 在合成状态跟踪任务上展示了优于标准 Transformer 与 GRU 的准确性,尤其是在评估长于训练序列的序列时。
相关
- 项目
- 项目
- 项目
- 项目