斯坦福 CS229 2026年春季 第6讲:偏差-方差权衡,正则化,双重下降,和 Hyperband
偏差-方差权衡:核心概念和动机
偏差-方差分解将期望测试误差表示为不可约噪声、平方偏差和方差之和。 讲座首先提出核心机器学习问题:给定一个有限的带噪样本,我们如何选择一个能够泛化的模型?当模型过于表达且拟合噪声时会发生过拟合,导致高方差;当模型过于简单时会发生欠拟合,导致高偏差。通过拟合一条直线(欠拟合)和一个高次多项式(过拟合)来对同一底层二次函数加高斯噪声的不同抽样进行直观解释。直线系统地偏离曲线(高偏差),而高次多项式在每个训练集上完全拟合,但在不同集合之间剧烈波动(高方差)。这些图像激发了正式的偏差-方差权衡。
偏差-方差分解的数学推导
通过展开期望平方损失并利用训练集抽取与测试点噪声的独立性,误差可分解为三项:噪声(σ²)、偏差²和方差。 推导固定一个测试点 X,抽取一个训练集 S,学习假设 h(S),然后抽取一个新的测试点 (X, Y),其中 Y = h★(X) + ε,ε ∼ N(0, σ²)。期望损失 E[(h(S)(X) − Y)²] 被展开,交叉项消失因为 ε 的均值为零且与 h(S) 独立。通过加减长期平均预测 h̄(X) = E_S[h(S)(X)] 得到: E[(h(S)(X) − Y)²] = σ² + E[(h̄(X) − h★(X))²] + E_S[(h(S)(X) − h̄(X))²] 第一项是不可避免的噪声,第二项是平方偏差(平均预测与真实函数之间的距离),第三项是方差(预测在不同训练集之间的波动)。此分解适用于任何假设类,是分析模型复杂性的基础。
正则化以减少方差
岭回归在最小二乘目标中加入 L2 惩罚,用偏差的小幅增加换取方差的大幅降低。 当设计矩阵 XᵀX 病态或奇异时,普通最小二乘可能具有巨大的方差,因为数据的微小变化会导致解的剧烈波动。岭回归求解 θ̂ = argmin_θ ‖y − Xθ‖² + λ‖θ‖² with λ > 0. 该惩罚将 θ 收缩向零,从而稳定解。在 XᵀX 的特征基底下,每个特征值 λ_i 被平移到 λ_i + λ,防止任何特征值变为零,从而限制 θ̂ 的方差。由于解被拉离无偏最小二乘估计,偏差略有增加,但方差显著下降,特别是当某些 λ_i 非常小时。这种偏差-方差权衡是正则化在实践中改善测试误差的原因。
现代发展:双重下降与鲁棒性
除了经典的 U 形偏差-方差曲线之外,现代过参数化模型表现出双重下降以及对分布偏移的意外鲁棒性。 讲师指出,经典理论预测在插值阈值之后(模型容量超过训练点数量时)测试误差必须上升。然而,最近的工作(例如 Misha Belkin 等人的双重下降论文)表明,在高度过参数化 regime 中,测试误差实际上可以再次下降——这一现象称为双重下降。直觉在于存在许多零损失解,优化器(例如梯度下降)的隐式偏差选择了一个平滑的解,从而具有良好的泛化能力。 此外,对数据集偏移的鲁棒性也进行了研究。ImageNet V2 论文(与其一位高级作者讨论过)使用新图像重建了 ImageNet 测试集。所有模型的准确率均下降了恰好 11 个点,但它们的相对排名保持不变。这一恒定偏移表明原始测试集和 V2 集以系统方式存在差异(例如,权重或相机特性),但在原始集上表现良好的模型在 V2 上也表现良好,这表明自适应过拟合(将测试集信息泄漏到训练中)在这些大规模视觉模型中不是主要问题。
模型选择:交叉验证和 Hyperband
为了选择超参数(例如岭罚 λ),我们需要一个不会污染最终测试集的验证信号。留出(dev)集可以达到此目的,但会浪费数据。K 折交叉验证将训练数据分成 K 折,在 K−1 折上训练,在留出的折上验证,轮换哪一折被留出。这提供了低偏差的泛化估计,同时在某个时点使用所有数据进行训练。 当训练每个候选模型代价高昂时,Hyperband 能提高效率。它先用少量步骤评估所有配置,淘汰表现最差的一半,将幸存者的训练时间翻倍,并重复此过程直至只剩一种配置。每轮大约消耗相同的总计算量,但表现更好的配置会获得指数级更多的资源。该方法易于实现,在某些单调性假设下具有强的理论保证,并减少了超参数搜索所需的完整训练运行次数。 这些工具——偏差-方差分析、正则化、如双重下降等现代见解以及实用的模型选择算法——构建了一个统一的框架,用于从有限的噪声数据中构建能够泛化的模型。