OpenAI 類神經語言模型縮放法則

OpenAI 已發現了主導類神經語言模型性能的經驗縮放法則。這些法則顯示,交叉熵損失(cross-entropy loss)相對於三個主要變數呈冪律(power-law)縮放:模型參數數量、訓練數據集大小以及用於訓練的總計算量。

可預測的性能縮放

以交叉熵損失衡量的語言模型性能,會隨著模型規模、數據集大小和計算量的增加而可預測地提升。這些冪律趨勢在超過七個數量級的範圍內保持一致。

雖然這些性能的主要驅動因素至關重要,但在廣泛的配置範圍內,其他架構選擇(例如特定的網絡寬度或深度)對性能的影響微乎其微。

資源分配與計算效率

可以使用簡單的方程式來確定固定計算預算的最佳分配方式,以實現性能最大化。此優化過程依賴於兩個關鍵的依賴關係:

  1. 過擬合(Overfitting): 過擬合與模型大小相對於數據集大小之間的關係。
  2. 訓練速度: 訓練速度與模型大小之間的關係。

大型模型中的樣本效率

較大的模型比較小的模型具有顯著更高的樣本效率。由於這種效率,訓練模型最有效率的計算方式是利用在相對適量數據上訓練的超大型模型。為了實現最大效率,應在模型達到完全收斂之前顯著提前停止訓練。

Sources