yifanzhang-pro/recurrent-looped-tranformer

Official Project Page for Recurrent Looped Transformer (RLT)

What it solves

표준 Transformer의 고정된 계산 깊이의 한계점을 해결합니다. 표준 Transformer는 시퀀스 길이에 관계없이 토큰당 처리량이 일정합니다. Recurrent Looped Transformer (RLT)는 "무한한 시간적 깊이"를 제공하여, 모델이 시퀀스가 길어짐에 따라 계산 경로를 확장할 수 있도록 하여 잠재적 추론 능력을 향상시키는 것을 목표로 합니다.

How it works

RLT는 인과적 인코더와 재귀적 디코더를 결합한 하이브리드 아키텍처를 사용합니다:

  • Causal Encoder: 입력의 글로벌 키-값 (KV) 메모리를 구축합니다.
  • Recurrent Decoder: 이 글로벌 메모리를 로컬 컨텍스트를 위한 슬라이딩 윈도우 어텐션 (SWA) 및 이전 토큰의 최종 은닉 상태를 다음 토큰의 처리 과정에 다시 피드백하는 피드백 루프와 결합합니디.
  • Unified Execution: 모델은 사전 학습, SFT, RL replay 과정에서 동일한 상태 전이 로직을 사용하여 모델의 학습 방식과 텍스트 생성 방식 사이의 일관성을 보재합니다.

Who it’s for

Transformer 아키텍처, 재循环형 신경망, 재귀적 추론론을 연구하는 연구자 및 개발자로서, 긴 시퀀스에 대한 표준 어텐션 메커니즘의 대안을 탐색하고자 하는 분들입니다.

Highlights

  • Infinite Temporal Depth: 계산 경로가 시퀀스 길이에 따라 선형적으로 성장하며, 각 토큰당 블록 수는 고정된 상태를 유지합니다.

  • Model-Hardware Co-design: 병렬 인코더 작업과 메모리 재사용을 통해 효율적인 학습 및 추론를 위한 최적적화가 이루어졌습니다.

  • Consistent State Transitions: 프롬프트 처리와 응답 생성 사이의 구조적 불일치를 제거합니다.

  • State-Tracking Performance: 합성 스테이트 트래킹 태스크에서 표준 Transformer와 GRU를 비교했을 때 우수한 정확도를 입증했습니다. 특히 학습 시 보았던 시퀀스보다 더 긴 시퀀스를 평가할 때 더욱 효과적입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트