Stanford CS229 2026年春季 第7講:神經網路 1(架構)
介紹
此講座作為深度學習的入門,著重於將神經網路視為一種結構化的非線性模型,用於監督學習任務,例如迴歸與分類。
監督學習框架
監督學習框架對於非線性模型保持不變:為每個樣本定義損失函數,在資料集上取平均,然後最小化由此得到的目標函數,相對於模型參數。
損失函數
對於迴歸,損失為平方誤差 (y_i − h_θ(x_i))²,可由高斯似然導出。對於多類別分類,模型透過 h_θ̄(x) 輸出 logits,損失為交叉熵損失 −log(exp(h_θ̄(x)_y) / Σ_j exp(h_θ̄(x)_j))。
透過梯度下降進行優化
為最小化損失,梯度下降更新 θ ← θ − η ∇J(θ)。計算完整梯度成本高昂,因此隨機梯度下降 (SGD) 會抽取單一樣本或一個小批次,以獲得無偏的梯度估計。SGD 中的噪聲有助於在非凸景觀中逃脫尖銳的極小點,儘管理論有限。
神經網路構建塊
神經元先進行仿射變換,再接上非線性激活。修正線性單元 (ReLU) 定義為 ReLU(t) = max(t, 0),因其對正輸入保持線性並將負輸入歸零而被廣泛使用。其他激活函數如 sigmoid、tanh 和 leaky ReLU 被提及為替代方案。
多層網路與記號
堆疊仿射‑激活對會產生多層感知器 (MLP)。以矩陣形式表示,一層計算 a = ReLU(Wx + b);後續層使用各自的權重矩陣和偏置向量重複此操作。總層數等於激活函數的應用次數。參數為所有 W 和 b 矩陣的集合。
殘差網路
殘差(跳躍)連接將層的輸入加到其輸出上:Z ← σ(W₂σ(W₁Z + b₁) + b₂) + Z。此 formulation 鼓勵網路學習殘差更新,簡化優化,並且在 2015 年 ResNet 論文中被推廣。
層正規化
LayerNorm 透過減去特徵向量 z 的平均值並除以其標準差來正規化,然後使用可學習參數 γ 和 β 進行縮放和平移:y = γ ⊙ (z − μ)/σ + β。變體如 RMSNorm 省略了平均值減法。正規化通過使層的輸出對其輸入的尺度不敏感來穩定訓練。
卷積網路(簡述)
卷積層使用稀疏且結構化的矩陣取代密集矩陣乘法,該矩陣在空間位置上共享權重,從而能夠高效處理如圖像這樣的網格結構資料。講義涵蓋此主題,儘管在現代視覺模型中較少使用,因為它們傾向於使用變換器。