Stanford CS229 Spring 2026 Lecture 6: 偏差-變異數權衡, 正則化, 雙重下降, 和 Hyperband
偏差-變異數權衡:核心概念與動機
偏差-變異數分解將預期測試誤差表示為不可約噪聲、平方偏差和變異數之和。 講座首先闡述核心機器學習問題:給定一個有限的帶噪樣本,我們如何選擇一個能夠泛化的模型?過度擬合發生在模型過於富有表現力且擬合噪聲時,導致高變異數;欠擬合發生在模型過於簡單時,導致高偏差。通過繪製適合直線(欠擬合)和高次多項式(過度擬合)在同一底層二次函數加上高斯噪聲的不同樣本上的圖像來建立直覺。直線系統地偏離曲線(高偏差),而高次多項式則完美擬合每個訓練集但在不同集合間劇烈波動(高變異數)。這些圖像促成了形式化的偏差-變異數權衡。
偏差-變異數分解的數學推導
通過展開預期平方損失並利用訓練集抽取與測試點噪聲的獨立性,誤差可分解為三個項:噪聲(σ²)、平方偏差(bias²)和變異數。 推導固定一個測試點 X,抽取一個訓練集 S,學得假設 h(S),然後抽取一個新的測試點 (X, Y),其中 Y = h★(X) + ε,且 ε ∼ N(0, σ²)。預期損失 E[(h(S)(X) − Y)²] 被展開,交叉項消失,因為 ε 的平均為零且與 h(S) 獨立。加上並減去長期平均預測 h̄(X) = E_S[h(S)(X)] 得到: E[(h(S)(X) − Y)²] = σ² + E[(h̄(X) − h★(X))²] + E_S[(h(S)(X) − h̄(X))²] 第一項是不可避免的噪聲,第二項是平方偏差(平均預測與真實函數的距離),第三項是變異數(預測在不同訓練集間的波動)。此分解適用於任何假設類別,是分析模型複雜度的基礎。
降低變異數的正則化
嶺迴歸在最小平方目標中加入 L2 罰項,以小幅增加偏差換取顯著降低變異數。 當設計矩陣 XᵀX 病態或奇異時,普通最小平方法可能因資料微小變動導致解劇烈波動而產生巨大變異數。嶺迴歸求解 θ̂ = argmin_θ ‖y − Xθ‖² + λ‖θ‖² with λ > 0. The penalty shrinks θ toward zero, which stabilizes the solution. In the eigenbasis of XᵀX, each eigenvalue λ_i is shifted to λ_i + λ, preventing any eigenvalue from becoming zero and thus bounding the variance of θ̂. The bias increases slightly because the solution is pulled away from the unbiased least‑squares estimate, but the variance drops dramatically, especially when some λ_i are very small. This bias‑variance tradeoff is the reason regularization improves test error in practice.
現代延伸:雙重下降與穩健性
除了經典的 U 型偏差-變異數曲線外,現代過參數化模型表現出雙重下降以及對分布轉移的意外穩健性。 講師指出,古典理論預測在插值閾值之後(模型容量超過訓練點數量時)測試誤差必會上升。然而,近期研究(例如 Misha Belkin 等人的雙重下降論文)表明,在高度過參數化的區域,測試誤差實際上可能再次下降——這就是所謂的雙重下降。直覺在於存在許多零損失解,而優化器(例如梯度下降)的隱式偏差會選擇一個光滑的解,從而具有良好的泛化能力。 此外,對資料集轉移的穩健性也進行了檢查。ImageNet V2 論文(與其一位高級作者討論過)使用新圖像重建了 ImageNet 測試集。所有模型的準確度均確實下降了 11 點,但其相對排名保持不變。這種固定的偏移表明原始測試集與 V2 集之間存在系統性差異(例如權重或相機特性),但在原始集上表現良好的模型在 V2 上也表現良好,這表明適應性過擬合(將測試集資訊洩漏到訓練中)在這些大規模視覺模型中並不是主要問題。
模型選擇:交叉驗證與 Hyperband
交叉驗證在不破壞測試集的情況下估計超參數表現;Hyperband 有效地將計算資源分配給有潛力的配置。 為選擇超參數(例如嶺迴歸的罰項 λ),我們需要一個不會污染最終測試集的驗證訊號。保留(驗證)集可以達到此目的,但會浪費資料。K‑fold 交叉驗證將訓練資料分成 K 個摺疊,在 K−1 個摺疊上進行訓練,在被保留的摺疊上進行驗證,並輪流更換被保留的摺疊。這種方法在某個時間點使用全部資料進行訓練時,能提供低偏差的泛化估計。 當每個候選模型的訓練成本較高時,Hyperband 能提高效率。它會對所有配置進行少量步驟的評估,捨棄表現最差的一半,將倖存者的訓練時間加倍,並重複此過程,直至只剩一個配置。每輪大致消耗相同的總計算量,但表現更好的配置會獲得指數級更多的資源。該方法實作簡單,在某些單調性假設下擁有強大的理論保證,並減少了超參數搜尋所需的完整訓練次數。 這些工具——偏差-變異數分析、正則化、如雙重下降等現代見解,以及實用的模型選擇演算法——構成了一個統一的框架,用於從有限且帶噪的資料中建構能夠泛化的模型。