權重正規化:加速深度神經網路訓練

TL;DR

權重正規化是神經網路權重向量的一種重新參數化,它將權重向量的長度與方向解耦。此技術改善了優化問題的條件數,加速了隨機梯度下降 (SGD) 的收斂,同時避免了批次正規化固有的小批量依賴。

核心機制:權重重新參數化

權重正規化透過將權重向量的大小與方向分離來加速訓練。透過解耦這兩個組件,優化過程變得更高效,改善了優化問題的條件數,並允許在訓練期間實現更快的收斂。

優於批次正規化的優勢

儘管受到批次正規化的啟發,權重正規化提供了幾項不同的技術優勢:

  • 無小批量依賴: 與批次正規化不同,權重正規化不會在小批量內的樣本間引入依賴關係。這使其成為特定架構的一個更穩定且更具彈性的替代方案。
  • 較低的計算開銷: 該方法實現更簡單,所需計算資源更少,從而在相同時間內可以執行更多的優化步驟。
  • 廣泛適用性: 由於它沒有小批量依賴,權重正規化可以成功應用於批次正規化較不適合的模型與應用,包括:
    • 如長短期記憶 (LSTM) 網路這樣的循環模型。
    • 對噪聲敏感的應用,例如生成模型。
    • 深度強化學習。

已示範的應用

OpenAI 已在機器學習的三個主要領域中展示了權重正規化的有效性:

  1. 監督學習圖像識別: 提升標準分類任務訓練的速度與穩定性。
  2. 生成建模: 提升生成新資料樣本模型的穩定性。
  3. 深度強化學習: 加速在複雜環境中代理人的訓練。

Sources