CS229 講義 3: 重み付き最小二乗法 (春 2026)

最小二乗法の確率的解釈

最小二乗解は、ガウスノイズモデルにおける最大尤度推定として導出できます。各ラベル y_i が theta transpose x_i に誤差 epsilon_i を加えたものであると仮定します。ここで epsilon_i は平均ゼロ、分散 sigma^2 の独立同分布の正規乱数変数です。theta を条件とした観測データの尤度は、各 epsilon_i のガウス密度の積となります。対数を取ると積が和になり、theta に依存しない定数を除くと、負の対数尤度は残差の二乗和に比例します。したがって、尤度を最大化することは最小二乗損失を最小化することと等価です。

最大尤度の原理

最大尤度フレームワークは、次の3つの手順から構成されます:入力とパラメータからラベルがどのように生成されるかを確率モデルで定義し、観測データセットの尤度をパラメータの関数として記述し、この尤度を最大化する(あるいは負の対数尤度を最小化する)パラメータ設定を選択します。この原則は一般的であり、特定の分布仮定に依存せず、ロジスティック回帰などの他のモデルにも再利用できます。

回帰から分類へ:ロジスティック回帰

ラベル y_i が 0 または 1 の二値分類において、最小二乗法を直接適用すると、連続値を離散的な結果に当てはめようとするため、決定境界が悪くなります。代わりに、線形スコア theta transpose x_i をシグモイドリンク関数 G(z) = 1/(1+exp(-z)) を通した関数として、y_i が 1 である確率をモデル化します。このベルヌーイモデルにおける単一観測の尤度は h_theta(x_i)^{y_i} (1‑h_theta(x_i))^{1‑y_i} です。データセット全体の対数尤度は、項 y_i log h_theta(x_i) + (1‑y_i) log(1‑h_theta(x_i)) の和となります。この対数尤度を最大化(あるいはその負を最小化)すると、ロジスティック回帰の目的関数が得られます。その結果得られる最適化問題は凸であり、勾配降下法や確率的勾配降下法などの一次法で解くことができます。

最適化:勾配降下法 vs ニュートン法

勾配降下法(その確率的変種を含む)は、目的関数の勾配と逆方向に小さなステップを移動することで theta を更新します;各イテレーションのコストは O(ND) で、N はデータ点の数、D は特徴の数です。ニュートン法は二次情報を使用し、2階導関数のヘッシアン行列を含む線形システムを解くことで theta を更新します。収束すると、ニュートン法はイテレーションごとにずっと速い進展を示し、しばしば一手で多くの桁の精度を得られます。ただし、各ニュートンステップではヘッシアンを形成し逆行列を計算する必要があり、O(ND^2 + D^3) の演算コストが発生し、N と D が大きい場合は実用的になりません。したがって、大規模な機械学習の設定では、収束が遅いものの確率的勾配降下法が好まれますが、特徴次元が modest な古典的統計問題ではニュートン法は依然として有用です。

Sources