OpenAI 神经网络语言模型的缩放定律
OpenAI 已经确定了支配神经网络语言模型性能的经验缩放定律(scaling laws)。这些定律表明,交叉熵损失(cross-entropy loss)相对于三个主要变量呈幂律关系缩放:模型参数的数量、训练数据集的大小以及用于训练的总计算量。
Predictable Performance Scaling
以交叉熵损失衡量的语言模型性能,随着模型规模、数据集规模和计算量的增加而可预测地提高。这些幂律趋势在超过七个数量级的范围内保持一致。
虽然这些性能的主要驱动因素至关重要,但在广泛的配置范围内,其他架构选择(例如特定的网络宽度或深度)对性能的影响微乎其微。
Resource Allocation and Compute Efficiency
可以使用简单的方程来确定固定计算预算的最优分配,以实现性能最大化。这一优化过程依赖于两个关键的依赖关系:
- Overfitting: 模型规模相对于数据集的大小与过拟合之间的关系。
- Training Speed: 训练速度与模型规模之间的关系。
Sample Efficiency in Large Models
较大的模型比较小的模型具有显著更高的样本效率。由于这种效率,训练模型最节省计算量的方式是使用在相对适量的数据上训练的超大型模型。为了实现最大效率,应在模型达到完全收敛之前显著提前停止训练。