斯坦福 CS229 2026年春季 第7讲:神经网络 1(架构)

引言

本讲座作为深度学习的入门,重点介绍神经网络作为回归和分类等监督学习任务的结构化非线性模型。

监督学习框架

对于非线性模型,监督学习框架保持不变:为每个样本定义损失函数,在数据集上求平均,然后最小化由此得到的目标函数,以模型参数为变量。

损失函数

对于回归,损失是平方误差 (y_i − h_θ(x_i))²,可以从高斯似然导出。对于多分类,模型通过 h_θ̄(x) 输出 logits,损失是交叉熵损失 −log(exp(h_θ̄(x)_y) / Σ_j exp(h_θ̄(x)_j))。

通过梯度下降进行优化

为了最小化损失,梯度下降更新 θ ← θ − η ∇J(θ)。计算完整梯度代价高昂,因此随机梯度下降(SGD)会采样单个样本或一个小批量以获得无偏的梯度估计。SGD 中的噪声有助于在非凸景观中逃脱尖锐的极小值,尽管理论有限。

神经网络构建块

神经元首先执行仿射变换,然后应用非线性激活函数。修正线性单元(ReLU)定义为 ReLU(t) = max(t, 0),因其对正输入保持线性并将负输入置零而被广泛使用。其他激活函数如 sigmoid、tanh 和 leaky ReLU 被提及作为替代方案。

多层网络和表示法

堆叠仿射-激活对得到多层感知器(MLP)。以矩阵形式,一层计算 a = ReLU(Wx + b);后续层使用各自的权重矩阵和偏置向量重复此操作。层的总数等于激活函数的应用次数。参数是所有 W 和 b 矩阵的集合。

残差网络

残差(跳连)连接将层的输入加到其输出上:Z ← σ(W₂σ(W₁Z + b₁) + b₂) + Z。这种形式鼓励网络学习残差更新,简化优化,并在 2015 年的 ResNet 论文中得到推广。

层归一化

LayerNorm 通过减去特征向量 z 的均值并除以其标准差来进行归一化,然后使用可学习的参数 γ 和 β 进行缩放和平移:y = γ ⊙ (z − μ)/σ + β。诸如 RMSNorm 之类的变体省略了均值减法。归一化通过使层的输出对输入的尺度不敏感来稳定训练。

卷积网络(简要)

卷积层使用在空间位置上共享权重的稀疏结构化矩阵来替代密集矩阵乘法,从而能够高效处理诸如图像之类的网格结构数据。讲义涵盖了此主题,尽管在现代偏好使用 transformer 的视觉模型中使用频率较低。

Sources