斯坦福 CS229 机器学习 2026年春季 讲座 2:监督学习设置

监督学习设置

监督学习从带标签的训练对中学习假设,以便对新输入预测输出。假设是一个将输入空间 X 映射到输出空间 Y 的函数 h。训练集由配对 (x^{(i)}, y^{(i)}) 组成,其中 x^{(i)} ∈ X 是一个输入示例,y^{(i)} ∈ Y 是其标签。目标是选择 h,使其在未见输入上的预测与真实输出尽可能接近,这一特性称为泛化。

回归 vs 分类

当输出空间 Y 包含实数时,问题为回归;当 Y 包含有限的离散标签集合时,问题为分类。回归的例子包括预测房价;分类的例子包括检测图像中是否包含猫或狗。讲义指出 chat‑GPT 使用分类器头来猜测下一个词,说明在更大系统内部存在一个分类组件。

线性假设和最小二乘

线性(仿射)假设的形式为 h_θ(x) = θ^T x,其中 θ 是参数向量,且约定 x_0 = 1 吸收了截距项。参数通过最小化平方误差测量的经验风险来选择。损失函数为 J(θ) = ½ Σ_{i=1}^n (h_θ(x^{(i)}) - y^{(i)})^2。将 J 对 θ 的梯度设为零可得到正规方程,在设计矩阵满足一定条件时,这给出闭形式解。

梯度下降基础

梯度下降通过沿梯度相反方向迭代更新参数向量 θ 来最小化 J:θ ← θ - α ∇J(θ)。步长 α 控制每次更新的移动幅度。如果 α 过大,更新可能会越过最小值并导致振荡;如果 α 过小,收敛会很慢。讲义指出选择 α 是一个实际问题,并且自适应优化器(例如 Adam、Adagrad)可以自动调整它。

随机梯度下降和小批量

随机梯度下降(SGD)用在随机选取的小批量训练样本上计算的梯度估计来替换完整批量梯度。这将每次迭代的计算成本从 O(n) 降低到 O(batch size),并使得在非常大的数据集上进行训练成为可能。小批量是均匀随机抽取的;有放回或无放回抽取在实际中表现相似,且无放回抽取通常更易实现。批量必须代表整体数据;否则模型可能会对抽取的子集产生过拟合(例如,只看到猫然后只看到狗)。批量大小涉及权衡:较小的批量会产生噪声较大的梯度但更新更频繁,而较大的批量则提供方差较低的梯度但需要更多内存和计算。在实际中,诸如 GPU 内存之类的系统考虑往往决定了所选的批量大小。

正规方程和线性代数

当设计矩阵 X(其行为 x^{(i)T})具有满列秩时,X^T X 可逆,最小二乘解为 θ* = (X^T X)^{-1} X^T y。此解为精确解,无需迭代。推导假设样本数 n 至少等于特征数 d(加上截距)。X^T X 是半正定的;可逆性要求其为正定。如果 X^T X 奇异,则解不唯一,零空间 中的任何向量都可以加到 θ* 上而不改变损失。

实际建议

学生在建模之前应先查看数据,因为可视化检查可以揭示模式和数据质量问题。讲义鼓励在直播课程中提问,并利用周五的 TA 环节复习符号、微积分和线性代数。提供的幻灯片和课程笔记是推荐的学习资源;合作讲师的笔记被描述为进行严谨学习的最完整参考。

Sources