yifanzhang-pro/deep-delta-learning
Official Project Page for Deep Delta Learning (https://arxiv.org/abs/2601.00417)
解決する課題
Deep Delta Learning (DDL) は、厳密に加算的な更新に依存する標準的な残差ネットワーク (ResNets) の限界に対処します。加算的なショートカットは勾配消失を防ぎますが、複雑で非単調な状態遷移をモデル化する能力を制限したり、深さが増すにつれて特徴干渉を引き起こしたりする可能性があります。
仕組み
DDLは、標準的な加算残差接続を、学習可能でデータ依存の幾何学的変換である Delta Operator に置き換えます。隠れ状態に単に新しい値を加算するのではなく、DDLは単位行列のランク1摂動を使用します。
プロセスには3つの主要コンポーネントが含まれます:
- Reflection Direction (k): 変換の軸を決定する正規化ベクトル。
- Scalar Gate (beta): 遷移挙動を制御する0から2の間の値。
- Residual Value Vector (v): 状態に注入される新しい情報。
ゲートを調整することで、ネットワークは3つのレジーム(アイデンティティ写像(信号の保持)、直交射影(特定情報の消去)、ハウスホルダー反射(振動ダイナミクスをモデル化するための状態の反転))の間を動的に切り替えることができます。
対象者
深層ニューラルネットワークアーキテクチャを設計する研究者やAIアーキテクト、特に深層残差スタイルのネットワークにおいて、層を越えた情報の保持または消去方法の改善を目指す人々。
ハイライト
- 幾何学的統一: アイデンティティ写像、直交射影、幾何学的反射を単一のモジュールに統合。
- Depth-Wise Delta Rule: 時間次元ではなく深さ次元に対してDelta Rule (Target - Current) を適用し、選択的な特徴の書き換えを可能にする。
- スペクトル制御: 層ごとの遷移演算子の固有値を明示的に制御し、表現力を高めつつ学習の安定性を維持する。
- Rank-1 Update: 計算効率の高いランク1のハウスホルダー更新を使用して、隠れ状態を調整する。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト