高斯判别分析(GDA) – 斯坦福 CS229 2026 春季 第 5 讲

生成模型 vs 判别模型

生成模型学习联合分布 P(X, Y) 或等价的 P(X|Y),以及类先验 P(Y);而判别模型直接学习条件分布 P(Y|X)。本讲将高斯判别分析(GDA)介绍为课程中首先学习的生成算法,与之前看到的判别模型(线性回归、逻辑回归)形成对比。

一维和二维的高斯分布

R^n 中的多元高斯分布由均值向量 μ 和协方差矩阵 Σ 刻画。协方差必须是对称且正定的,这保证 Σ 有良好定义的逆矩阵,并且其特征值全部为正。密度函数中包含指数内的项 (x−μ)^T Σ^−1 (x−μ),归一化常数包含 Σ 的行列式。等概率的轮廓是椭圆,其方向和形状由 Σ 决定。

高斯判别分析模型

GDA 假设对于每个类别 k,特征 X 服从具有类别特定均值 μ_k 的高斯分布,但所有类别共享同一个协方差 Σ。类别标签 Y 被建模为先验概率为 π_k = P(Y=k) 的伯努利变量。因此,生成过程是:先根据类别先验抽取标签,然后从对应标签的高斯分布中抽取 X。

GDA 的最大似然估计

给定一个带标签的数据集,最大似然估计具有封闭形式的解。类别先验通过经验频率估计:π̂k = N_k / N,其中 N_k 是标签为 k 的样本数。类别特定均值是分配到该类别的特征的平均值:μ̂_k = (1/N_k) Σ{i:y_i=k} x_i。共享协方差通过汇总所有类别的散度来估计:Σ̂ = (1/N) Σ_{k} Σ_{i:y_i=k} (x_i − μ̂_k)(x_i − μ̂_k)^T。这些公式仅涉及计数和平均,无需迭代优化。

决策边界与逻辑回归的关系

当协方差 Σ 被共享时,两个类别之间的对数似然比简化为 x 的仿函数,因此 GDA 的决策边界是一个超平面(线性)。如果每个类别允许具有自己的协方差,则边界变为二次(二次判别分析,QDA)。讲义指出,这一线性边界也可以通过逻辑回归模型获得,表明数据上的许多生成假设会导致相同的判别形式。

离散特征的朴素贝叶斯

对于二元词存在特征,朴素贝叶斯假设在给定类别的情况下特征是条件独立的。这一假设将参数数量从特征数量的指数级降低到线性级:每个类别每个特征一个伯努利参数,再加上类别先验。最大似然估计仅仅是每个类别中每个词的经验频率(使用拉普拉斯平滑以避免零概率)。得到的分类器在训练和评估上开销小,并且可作为诸如垃圾邮件过滤等任务的简单生成基线。

Sources