Stanford CS229 Spring 2026 Lecture 4: 指數族群, 廣義線性模型, 和 Softmax
Stanford CS229 Spring 2026 Lecture 4: 指數族群, 廣義線性模型, 和 Softmax
指數族群提供了一種單一的函數形式,能夠捕捉許多常見的分布,使得推論與學習可以在不考慮具體分布的情況下,使用相同的推導進行。這很重要,因為它是廣泛使用模型的基礎,例如邏輯回歸、softmax 多分類分類以及現代神經網路的最終層。
指數族群形式與動機
如果一個機率分布可以寫成 exp(ada^T * t(y) - a(ada) + b(y)) 的形式,則該分布屬於指數族群。其中 ada 是自然參數,t(y) 是充分統計量,a(ada) 是對數配分函數,而 b(y) 是不依賴 ada 的基礎測度。此形式確保了歸一化由 a(ada) 處理,使得分布的總和為一。
範例: 貝努利和高斯
對於均值為 φ 的伯努利變數 y ∈ {0,1},充分統計量 t(y) 是 y,自然參數 ada 是 log(φ/(1−φ)),對數配分函數 a(ada) 是 log(1+exp(ada)),而 b(y) 是零。對於已知變異數的高斯分布,t(y) 是 y,ada 是 μ/σ²,a(ada) 是 μ²/(2σ²) 加上一個常數,而 b(y) 包含二次項 −y²/(2σ²)。這兩個範例都符合規定的形式。
關鍵性質: 對數配分函數給出期望和方差
對數配分函數 a(ada) 對 ada 的一階導數等於充分統計量 t(y) 的期望。二階導數等於 t(y) 的變異數。這對指數族群中的任何分布都成立,因此一旦已知對數配分函數,期望和變異數就可以「免費」取得,而無需重新推導矩。
廣義線性模型 (GLM) 框架
在監督學習中,我們通過選擇一個指數族群分布來建模 p(y|x;θ),其中該分布的自然參數 ada 被設定為等於 θ^T x。預測輸出 h_θ(x) 是給定 x 下 t(y) 的期望,可透過對 a(ada) 求導獲得。學習透過最大化資料的對數似然進行,這會導致一個梯度上升更新,當充分統計量是單位矩陣時,可以寫為 θ ← θ + (y − h_θ(x)) x。
Softmax 和多分類分類
當 y 是以 one‑hot 向量編碼的離散類別標籤時,充分統計量就是 y 本身,而自然參數 ada 是每個類別 j 的分數向量 θ_j^T x。對數配分函數 a(ada) 是 log(∑_j exp(θ_j^T x))。得到的分布就是 softmax:p(y=j|x) = exp(θ_j^T x) / ∑_k exp(θ_k^T x)。這正是神經網路中使用的多分類分類模型。
與邏輯回歸的關聯 (K=2 情況)
當只有兩個類別時,softmax 簡化為邏輯回歸。由於機率必須加總為一,只有其一個分數是自由的;定義 θ = θ_1 − θ_2 會將兩類別的 softmax 折疊為 σ(θ^T x) = 1/(1+exp(−θ^T x)),這就是邏輯函數。
訓練: 最大似然, 交叉熵, 梯度下降
最大化 softmax 模型的對數似然會得到交叉熵損失:−∑_j y_j log(p_j),其中 y_j 是 one‑hot 標籤。在這個損失上進行隨機梯度下降會更新參數為 θ ← θ + (y − p) x,其中 p 是 softmax 概率的向量。此更新規則符合直覺:增加正確類別的分數,減少錯誤類別的分數。
標籤平滑直覺
標籤平滑將硬 one‑hot 標籤替換為一個在錯誤類別上賦予少量機率的分布。這可以防止模型變得過度自信,起到正則化的作用,並使訓練對噪聲標籤更具穩健性。相同的交叉熵公式也適用於軟化後的標籤。
實務注意: 實作與數值穩定性
在實務上,函式庫會在指數化之前減去最大分數來以數值穩定的方式計算 softmax。底層數學保持不變:對分數進行指數化,除以它們的總和,得到總和為一的機率分布。這些操作是大多數現代 AI 系統的最終層,包括那些逐個 token 生成文字的系統。