スタンフォード CS229 2026年春 第7講: ニューラルネットワーク 1 (アーキテクチャ)
はじめに
この講義はディープラーニングの導入として機能し、回帰や分類などの教師あり学習タスクのための構造化された非線形モデルとしてのニューラルネットワークに焦点を当てています。
教師あり学習のフレームワーク
教師あり学習のフレームワークは非線形モデルに対して変わらず、各例について損失関数を定義し、データセット全体で平均を取り、その結果得られた目的関数をモデルパラメータに関して最小化します。
損失関数
回帰の場合、損失は二乗誤差 (y_i − h_θ(x_i))² であり、これはガウス尤도から導出できます。多クラス分類の場合、モデルは h_θ̄(x) を介してロジットを出力し、損失はクロスエントロピー損失 −log(exp(h_θ̄(x)_y) / Σ_j exp(h_θ̄(x)_j)) となります。
勾配降下法による最適化
損失を最小化するために、勾配降下法は θ ← θ − η ∇J(θ) と更新します。完全な勾配を計算するのはコストが高いため、確率的勾配降下法 (SGD) は単一の例またはミニバッチをサンプリングして勾配の無偏推定を得ます。SGD のノイズは非凸な景観における鋭い局所 minima から逃れるのに役立ちますが、理論的には限界があります。
ニューラルネットワークの構成要素
ニューロンはアフィン変換を適用した後、非線形活性化関数を適用します。整流線形ユニット (ReLU) は ReLU(t) = max(t, 0) と定義され、正の入力に対して線形性を保ち、負の入力をゼロにするため広く使用されています。シグモイド、tanh、漏れる ReLU (leaky ReLU) などの他の活性化関数も代替として挙げられます。
多層ネットワークと表記法
アフィン変換と活性化関数のペアを積み重ねると、多層パーセプトロン (MLP) が得られます。行列形式では、層は a = ReLU(Wx + b) を計算し、その後の層はそれぞれの重み行列とバイアスベクトルを使って同じ操作を繰り返します。層の総数は活性化関数の適用回数と等しくなります。パラメータはすべての W と b の行列の集合です。
残差ネットワーク
残差(スキップ)接続は、層の入力をその出力に加えます: Z ← σ(W₂σ(W₁Z + b₁) + b₂) + Z。この式はネットワークが残差更新を学ぶことを促し、最適化を容易にし、2015年の ResNet 論文で広まりました。
レイヤー正規化
LayerNorm は特徴ベクトル z の平均を引いて標準偏差で割ることで正規化し、学習可能なパラメータ γ と β でスケーリングとシフトを行います: y = γ ⊙ (z − μ)/σ + β。平均を引かない RMSNorm などのバリエーションもあります。正規化は、層の出力が入力のスケールに依存しないようにすることで訓練を安定化します。
畳み込みネットワーク(簡潔)
畳み込み層は、密な行列乗算を空間的な位置で重みを共有する疎で構造化された行列に置き換え、画像などのグリッド構造データの効率的な処理を可能にします。講義ノートではこのトピックを扱いますが、トランスフォーマーを好む現代のビジョンモデルではあまり頻繁には使用されません。