yifanzhang-pro/deep-delta-learning
Official Project Page for Deep Delta Learning (https://arxiv.org/abs/2601.00417)
解決的問題
Deep Delta Learning (DDL) 解決了標準殘差網路 (ResNets) 的局限性,後者依賴於嚴格的加法更新。雖然加法快捷路徑可以防止梯度消失,但它們可能會限制網路建模複雜、非單調狀態轉換的能力,並隨著深度的增加而產生特徵干擾。
工作原理
DDL 用一種可學習的、數據依賴的幾何轉換——Delta Operator 取代了標準的加法殘差連接。DDL 不是簡單地向隱藏狀態添加新值,而是使用單位矩陣的秩-1 擾動。
該過程包含三個關鍵組件:
- Reflection Direction (k):決定轉換軸的歸一化向量。
- Scalar Gate (beta):控制轉換行為的 0 到 2 之間的值。
- Residual Value Vector (v):注入到狀態中的新資訊。
透過調整門控,網路可以在三種模式之間動態切換:恆等映射(保留訊號)、正交投影(擦除特定資訊)和 Householder 反射(透過反轉狀態來建模振盪動力學)。
適用對象
設計深度神經網路架構的研究人員和 AI 架構師,特別是那些希望改進深度殘差風格網路中跨層資訊保留或擦除方式的人員。
亮點
- 幾何統一:將恆等映射、正交投影和幾何反射統一到一個模組中。
- 深度維度的 Delta 規則:在深度維度而非時間維度應用 Delta 規則 (Target - Current),從而實現選擇性的特徵重寫。
- 譜控制:顯式控制逐層轉換算子的特徵值,在提高表達能力的同時保持訓練穩定性。
- 秩-1 更新:使用計算效率極高的秩-1 Householder 更新來調節隱藏狀態。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案