yifanzhang-pro/recurrent-looped-tranformer

Official Project Page for Recurrent Looped Transformer (RLT)

What it solves

標準的な Transformer は、シーケンスの長さに依存せず、各 token ごとの処理量が一律であるという固定深度計算の制限があります。Recurrent Looped Transformer (RLT) は、「無限の時間的深度」を提供し、シーケンスが長くなるにつれて計算パスを拡張できるため、モデルの潜在的な推論能力を向上させることが目的です。

How it works

RLT は、因果的エンコーダーと再帰的デコーダーを組み合わせたハイブリッドアーキテクチャを使用します:

  • Causal Encoder: 入力のグローバルなキー・バリュー (KV) メモリを構築します。
  • Recurrent Decoder: このグローバルメモリと、ローカルな文脈のためのスライディングウィンドウ・アテンション (SWA) 、および前の token の最終隠れ状態を次の token の処理にフィードバックバックループを使用します。
  • Unified Execution: モデルは、事前学習、教師あり微調整 (SFT)、RL replay において、同一のステート遷移ロジックを使用し、モデルの学習方法とテキスト生成方法の一貫性を確保します。

Who it’s for

Transformer アーキテクチャ、再帰型ニューラルネットワーク、および潜在的な推論に関する研究者や開発者で、長いシーケンスのための標準的なアテンション・メカニズムの代替案を探索したいと考えている方々です。

Highlights

  • Infinite Temporal Depth: 計算パスはシーケンス長に対して線形に成長し、各 token ごとのブロック数を固定に保ちます。

  • Model-Hardware Co-design: 並列エンコーダー作業とメモリ再利用による、効率的な学習と推論のための最適化が行われています。

  • Consistent State Transitions: プロンプト処理とレスポンス生成の間の構造的な不一致を解消します。

  • State-Tracking Performance: 合成的なステート・トラッキング・タスクにおいて、標準的な Transformer と GRU と比較して、優れた精度を実証 demonstrate を示しています。特に、学習時よりも長いシーケンスを評価する際によ de 示します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト