EM 高斯混合模型算法和主成分分析 – 斯坦福 CS229 第10讲 (2026年春季)
EM 高斯混合模型算法
EM 算法通过迭代构建对数似然的下界并最大化它,提供了一种原则性的方法来拟合高斯混合模型。
E‑Step: 通过詹森不等式构建下界
E‑step 构建一个在当前参数处紧致且在其他地方低于真实对数似然的代理函数。 对于每个数据点,我们在潜在变量 Z 上引入一个分布 Q。通过将对数似然表示为 Q 上的期望并对凹的对数函数应用詹森不等式,我们得到一个下界。当 Q 被选择为后验 P(Z|X,θ) 时,即给定当前参数猜测的每个成分的条件概率,该下界变得紧致。这种选择使得代理函数在当前 θ 处与真实似然相接触,并保证最大化代理函数不会降低真实似然。
M‑Step: 更新均值、协方差和混合比例
根据 E 步得到的责任,M 步最大化期望完全数据对数似然,这简化为高斯的加权最大似然估计。
- 第 j 个成分的均值更新为数据点的责任加权平均值。
- 第 j 个成分的协方差更新为围绕新均值的责任加权二阶中心矩。
- 混合比例 π_j 更新为第 j 个成分的平均责任(以确保它们的和为一,通常通过拉格朗日乘数实现)。 这些更新通过将代理函数的导数设为零得到。
与 K‑均值的联系及单调收敛
高斯混合模型的 EM 算法推广了 K‑均值:K‑均值使用硬分配且仅更新均值,而 EM 使用软责任并且还估计协方差和混合权重。由于代理函数在当前参数处紧致且为凹函数,每次 EM 迭代都会增加(或保持不变)真实对数似然,从而保证收敛到局部最大值或鞍点的单调性。
主成分分析(PCA)
PCA 找到在中心化数据中捕获最大方差的正交方向,提供低维表示。
居中、缩放及方差最大化视角
首先,通过减去均值将数据居中,使得第一主成分描述围绕原点的扩散方向。可选地,将每个特征缩放到单位方差,以防止原始尺度较大的特征在方差准则上占主导。居中后,PCA 求解单位向量 u,使得投影数据的方差最大化,等价于最小化垂直残差的平方和。
特征分解解释及成分选择
最大化问题归约为经验协方差矩阵(XᵀX/(n‑1))的特征值问题。特征向量是主成分;对应的特征值等于每个成分解释的方差。特征值按降序排列,因此第一个特征向量给出最大方向的方差,第二个特征向量给出下一个正交方向的最大残差方差,以此类推。将数据投影到前 k 个特征向量上可得到保留最多方差的 k 维表示。
实际注意事项及 PCA 失效时
PCA 假设感兴趣的方向对应于协方差矩阵中相隔较远的特征值。如果特征值接近,估计的特征向量可能不稳定,导致在新数据上得到不同的成分。该方法也不处理缺失值;缺失数据必须事先填补或丢弃。最后,只有当目标是保留方差时,PCA 才是合适的;如果预测信号位于低方向方差中,PCA 可能会丢弃有用的信息。