Anthropic 揭示了 Transformer 残差流中的特权基底
TL;DR
Anthropic 发现 Transformer 残差流中的单个坐标并不是数学上任意的;它们与特权基底对齐,他们将这一现象主要归因于 Adam 的逐维度归一化器,而不是层归一化(layer normalization)或浮点精度。
关键发现:存在基底对齐
经验分析表明,残差流维度携带了系统性信息,这与基底方向应该是可互换且不携带特殊含义的理论预期相矛盾。
调查原因
Adam 优化器归一化器
作者初步将 Adam 优化器中的逐维度归一化器确定为观察到的基底对齐最可能的来源。Adam 对每个参数进行单独缩放,这可能会在学习到的表示中引入一致的方向性偏差。
层归一化已被排除
实验表明,层归一化不会产生特权基底效应。更改或移除层归一化层不会改变对齐情况,表明它不是原因。
有限精度算术已被排除
通过改变浮点精度(例如 float32 对比 float64)进行的测试显示,对基底对齐没有影响,这使得作者能够自信地排除有限精度计算作为来源。
对 Transformer 理论的影响
这一发现挑战了残差流坐标系是任意的这一假设。如果优化器动力学在基底上印刻了结构,那么在分析表示几何时,Transformer 的理论模型必须考虑优化器引起的各向异性。
更广泛的背景
Anthropic 将这项工作与其它前沿模型研究并列,例如:
- Emerging Multi-Agent Systems – 探索可能导致系统性故障的行为模式。
- Worker Retraining Evidence Review – 与外部研究人员共同撰写的政策导向型综述。
- Claude’s Mathematical Capabilities – 强调了 Claude 的一个研究版本,该版本在与黎曼猜想相关的界限方面取得了进展。
这些链接说明了 Anthropic 在先进 AI 的技术和社会层面上的广泛关注。
结论
特权基底现象似乎与 Adam 的逐维度缩放有关,而不是与层归一化或数值精度有关。识别优化器驱动的基底偏差对于准确地对 Transformer 内部进行理论建模是至关重要的,并且可能会影响未来的架构和训练算法设计。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch