OpenAI 深度双重下降

OpenAI 已证明,双重下降现象发生在各种深度学习架构中,包括 CNNs、ResNets 和 transformers。这种行为表现为一种模式,即随着模型大小、数据大小或训练时间的增加,模型性能首先提高,然后恶化,最后再次提高。

Model-Wise Double Descent

随着模型规模的增加,测试误差并不遵循单调路径;相反,它表现出“双重下降”模式。随着神经网络中参数数量的增长,测试误差最初会下降,然后增加到峰值,最后一旦模型足够大以拟合训练集,就会经历第二次下降。

Sample-Wise Non-Monotonicity

在特定阶段,增加训练数据的量可能会导致更差的测试性能。虽然增加更多样本通常会将整体误差曲线向下移动,但它也会将插值阈值和相关的测试误差峰值向右移动,因为需要更大的模型来拟合更大的数据集。

Epoch-Wise Double Descent

训练模型的时间更长可以逆转过拟合。对于固定的模型大小,随着优化步骤的训练进行,测试和训练误差可能会下降、增加,然后再次下降。这被称为 epoch-wise double descent。

Theoretical Intuition and Open Questions

OpenAI 建议,在插值阈值处,实际上只有一种模型可以拟合训练数据。迫使这种单一模型去拟合带噪声或错误指定的标签,会破坏其全局结构,从而导致没有“好模型”既能插能拟合训练集又能在测试集上表现良好。

In the over-parameterized regime, however, many models can fit the training set. The implicit bias of stochastic gradient descent (SGD) is believed to lead the optimization process toward "good models" that generalize well, although the exact mechanism remains an open research question.

Careful regularization and early stopping are noted as common methods to avoid the double descent peak.

Sources