yifanzhang-pro/deep-delta-learning
Official Project Page for Deep Delta Learning (https://arxiv.org/abs/2601.00417)
解决的问题
Deep Delta Learning (DDL) 解决了标准残差网络 (ResNets) 的局限性,后者依赖于严格的加法更新。虽然加法快捷路径可以防止梯度消失,但它们可能会限制网络建模复杂、非单调状态转换的能力,并随着深度的增加而产生特征干扰。
工作原理
DDL 用一种可学习的、数据依赖的几何变换——Delta Operator 取代了标准的加法残差连接。DDL 不是简单地向隐藏状态添加新值,而是使用单位矩阵的秩-1 扰动。
该过程包含三个关键组件:
- Reflection Direction (k):决定变换轴的归一化向量。
- Scalar Gate (beta):控制转换行为的 0 到 2 之间的值。
- Residual Value Vector (v):注入到状态中的新信息。
通过调整门控,网络可以在三种模式之间动态切换:恒等映射(保留信号)、正交投影(擦除特定信息)和 Householder 反射(通过反转状态来建模振荡动力学)。
适用对象
设计深度神经网络架构的研究人员和 AI 架构师,特别是那些希望改进深度残差风格网络中跨层信息保留或擦除方式的人员。
亮点
- 几何统一:将恒等映射、正交投影和几何反射统一到一个模块中。
- 深度维度的 Delta 规则:在深度维度而非时间维度应用 Delta 规则 (Target - Current),从而实现选择性的特征重写。
- 谱控制:显式控制逐层转换算子的特征值,在提高表达能力的同时保持训练稳定性。
- 秩-1 更新:使用计算效率极高的秩-1 Householder 更新来调节隐藏状态。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目