高斯判別分析 (GDA) – Stanford CS229 2026年春季 第5講

生成式 vs 判別式建模

生成式模型學習聯合分布 P(X, Y) 或等價的 P(X|Y),並結合類別先驗 P(Y),而判別式模型則直接學習條件分布 P(Y|X)。在本講義中,高斯判別分析 (GDA) 作為課程中首個被研究的生成式算法被介紹,與先前看到的判別式模型(線性回歸、邏輯回歸)形成對比。

一維和二維的高斯分布

在 R^n 中的多變量高斯分布由均值向量 μ 和協方差矩陣 Σ 特徵化。協方差必須是對稱且正定的,這保證 Σ 有明確定義的逆矩陣,且其特徵值皆為正。密度函數包含指數內的項 (x−μ)^T Σ^−1 (x−μ),而正規化常數包含 Σ 的行列式。等概率的輪廓是橢圓,其方向和形狀由 Σ 決定。

高斯判別分析模型

GDA 假設對於每個類別 k,特徵 X 服從具有類別特定均值 μ_k 的高斯分布,但所有類別共享協方差 Σ。類別標籤 Y 被建模為先驗為 π_k = P(Y=k) 的伯努利變數。因此,生成故事是:先根據類別先驗抽取標籤,然後從對應該標籤的高斯分布中抽取 X。

GDA 的最大似然估計

給定一個已標註的資料集,最大似然估計具有封閉形式的解。類別先驗透過經驗頻率估計:π̂k = N_k / N,其中 N_k 是標籤為 k 的樣本數。類別特定均值是該類別特徵的平均值:μ̂_k = (1/N_k) Σ{i:y_i=k} x_i。共享協方差透過將所有類別的散佈矩陣加總來估計:Σ̂ = (1/N) Σ_{k} Σ_{i:y_i=k} (x_i − μ̂_k)(x_i − μ̂_k)^T。這些公式僅涉及計數和平均,無需迭代優化。

決策邊界與邏輯回歸的關係

當協方差 Σ 共享時,兩個類別之間的對數似然比簡化為 x 的仿射函數,因此 GDA 的決策邊界是一個超平面(線性)。如果允許每個類別擁有自己的協方差,則決策邊界變為二次(二次判別分析,QDA)。講義指出,這個線性邊界也可以透過邏輯回歸模型獲得,表明資料上的許多生成式假設會導致相同的判別式形式。

離散特徵的朴素貝葉斯

對於二元詞彙存在特徵,朴素貝葉斯假設在給定類別下特徵是條件獨立的。此假設將參數數量從特徵數量的指數減少到線性:每個類別每個特徵有一個伯努利參數,加上類別先驗。最大似然估計僅是每個類別中每個詞的經驗頻率(使用拉普拉斯平滑以避免零概率)。得到的分類器在訓練和評估上成本低廉,並且可作為垃圾郵件過濾等任務的簡單生成式基線。

Sources