スタンフォード CS229 機械学習 2026年春 講義12: 表現学習

拡散モデルのトレーニングと損失関数

拡散モデルは、前方ノイズプロセスを逆転させることを学習することでトレーニングされます。目標は、ノイズからきれいな画像を再構成できる逆分布 $p_ heta(x_{t-1} | x_t)$ をパラメータ化することです。

損失関数

拡散モデルのトレーニングの形式的な目的は、データの対数尤度を最大化することであり、これにより証拠下限(ELBO)が導かれます。これは $t=1$ から $T$ までの項 $L_{t-1}$ の列に簡略化されます。

実際には、ELBO から導かれる複雑な係数はしばしば省略されます。トレーニングの目的は、元のデータ $x_0$ が与えられた逆プロセスの真の平均と予測された平均 $\mu_\theta(x_t, t)$ の二乗差の和を最小化することになります:

$$ \text{Loss} = \mathbb{E} [\mu_{\tilde{t}}(x_t, x_0) - \mu_\theta(x_t, t)]^2 $$

ノイズ予測の再パラメータ化

平均 $\mu_\theta$ を直接予測するのではなく、実務者は通常、ネットワークを再パラメータ化して、元の画像 $x_0$ に加えられたノイズ $\epsilon$ を予測し、ノイズが加わった画像 $x_t$ を作成します。

By hardcoding the known linear relationship between $x_t$, $x_0$, and the noise $\epsilon$, the loss function simplifies to a noise prediction problem:

$$ \text{Loss} = \mathbb{E} [\epsilon - \epsilon_\theta(x_t, t)]^2 $$

これにより、生成タスクはより小さく、局所的に簡単な再構成ステップのシリーズに変わります。モデルは純白ノイズから始まり、各ステップで画像を徐々にシャープにし、詳細を追加します。

ファウンデーションモデルパラダイム

ファウンデーションモデルは、機械学習におけるタスク固有のトレーニングから、プリトレーニングと適応の二段階パラダイムへのシフトを表します。

プリトレーニング

プリトレーニングでは、巨大で多様で、しばしばラベルのないデータセット上でモデルをトレーニングします。焦点は、厳密なデータ品質よりもスケールと多様性に置かれます。この段階では、「ファウンデーション」—データから広範な意味情報を捉える汎用モデル—が作成されます。

適応

適応とは、プリトレーニングされたファウンデーションモデルを特定のダウンストリームタスクに合わせて調整するプロセスです。これはいくつかの設定で発生します。

  • ゼロショット学習: モデルは、タスク固有のトレーニングデータなしで、説明に基づいてタスクを解決します。
  • 少数ショット学習: モデルは、非常に小さなラベル付きデータセット(例:5-10例)を使用して適応されます。
  • ファインチューニング: モデルは、特定のタスクのためのより大きなラベル付きデータセットを使用して更新されます。

表現学習と適応技術

表現学習は、生データ $x$ を低次元ベクトル(埋め込みまたは特徴)にマッピングするモデル $f_\theta$ のトレーニングに焦点を当てます。この表現はその後、ダウンストリームタスクを解決するために使用されます。

線形プロービング

線形プロービングは、表現モデル $f_\theta$ を凍結した状態で保ち、固定された埋め込みの上に単純な線形ヘッド(重みベクトル $w$)をトレーニングしてターゲット $y$ を予測する技術です。これは非常に効果的であり、プリトレーニングされた表現はしばしば生データにおける非線形関係を埋め込み空間における線形関係に変換するためです。

ファインチューニングとLPFT

フルファインチューニングでは、線形ヘッド $w$ と表現パラメータ $\theta$ の両方が最適化されます。損失関数は線形プロービングと同じ場合がありますが、プリトレーニングされたモデルで $\theta$ を初期化すると、スクラッチからトレーニングするよりも通常、より良いグローバル最小点と優れたテスト性能に導かれます。

LPFT (線形プロービング その後 ファインチューニング) はハイブリッドアプローチであり、モデルはまず線形プロービング($w$ のみを最適化)でトレーニングされ、ヘッドと表現の間の安定した接続を確立します。その後、$w$ と $\theta$ を共同で最適化します。これにより、ファインチューニングの初期段階で線形ヘッドのランダム初期化によってプリトレーニングされた表現が「破壊」されるのを防ぎます。

ローランク適応 (LoRA)

LoRAは、大規模モデルの数十億のパラメータをすべて更新することを避ける効率的な適応手法です。重み行列 $W$ を $W + \Delta W$ に更新する代わりに、LoRAは更新 $\Delta W$ を低ランク分解 $\Delta W = AB$ に制限します。ここで、$A$ と $B$ ははるかに小さな内部次元 $r$ を持つ行列です。

LoRAの利点

  • メモリ効率: フォワードパスではまだ元の凍結された重み $W_0$ が必要ですが、LoRAは勾配とオプティマイザー状態(Adamのモメンタムなど)に必要なメモリを大幅に削減します。これは、これらが小さな行列 $A$ と $B$ のみに保存されるためです。
  • マルチテナントサービング: LoRAは多数のユーザーにサービスを提供するのに理想的です。単一の共有された $W_0$ をメモリに保持しながら、ユーザー固有の小さなアダプター ($A_i, B_i$) を素早く入れ替えることができます。これにより、プロバイダーは巨大なベースモデルを各ユーザーごとに複製することなく、数千のカスタマイズされたモデルを提供することができます。

Sources