yifanzhang-pro/deep-delta-learning

Official Project Page for Deep Delta Learning (https://arxiv.org/abs/2601.00417)

해결하는 문제

Deep Delta Learning (DDL)은 엄격하게 가산적인 업데이트에 의존하는 표준 잔차 네트워크(ResNets)의 한계를 해결합니다. 가산적 숏컷은 기울기 소실을 방지하지만, 복잡하고 비단조적인 상태 전이를 모델링하는 능력을 제한할 수 있으며 깊이가 증가함에 따라 특징 간섭이 발생할 수 있습니다.

작동 원리

DDL은 표준 가산 잔차 연결을 학습 가능하고 데이터 의존적인 기하학적 변환인 Delta Operator로 대체합니다. 은닉 상태에 단순히 새로운 값을 더하는 대신, DDL은 단위 행렬의 랭크-1 섭동(rank-1 perturbation)을 사용합니다.

프로세스에는 세 가지 핵심 구성 요소가 포함됩니다:

  1. Reflection Direction (k): 변환 축을 결정하는 정규화된 벡터.
  2. Scalar Gate (beta): 전이 동작을 제어하는 0과 2 사이의 값.
  3. Residual Value Vector (v): 상태에 주입되는 새로운 정보.

게이트를 조정함으로써 네트워크는 세 가지 레지임(아이덴티티 매핑(신호 보존), 직교 투영(특정 정보 삭제), 하우스홀더 반사(진동 역학 모델링을 위한 상태 반전)) 사이를 동적으로 전환할 수 있습니다.

대상

심층 신경망 아키텍처를 설계하는 연구자 및 AI 아키텍트, 특히 심층 잔차 스타일 네트워크에서 레이어 간 정보 보존 또는 삭제 방식을 개선하고자 하는 전문가.

주요 특징

  • 기하학적 통합: 아이덴티티 매핑, 직교 투영 및 기하학적 반사를 단일 모듈로 통합.
  • Depth-Wise Delta Rule: 시간 차원이 아닌 깊이 차원에 Delta Rule (Target - Current)을 적용하여 선택적 특징 재작성을 가능하게 함.
  • 스펙트럼 제어: 레이어별 전이 연산자의 고유값을 명시적으로 제어하여 표현력을 높이면서 학습 안정성을 유지함.
  • Rank-1 Update: 계산 효율적인 랭크-1 하우스홀더 업데이트를 사용하여 은닉 상태를 조절함.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트