スタンフォード CS229 2026年春 講義 6: バイアス‑分散トレードオフ、正則化、ダブルデセント、そしてハイパーバンド
バイアス‑分散トレードオフ: 基本概念と動機
バイアス‑分散分解は、期待されるテスト誤差を、不可避なノイズ、二乗バイアス、分散の合計として表現します。
講義は、中心的な機械学習の問いを提示することから始まります: 有限かつノイズのあるサンプルが与えられたとき、どのようにして汎化できるモデルを選択すべきか? モデルが過度に表現力を持ちノイズまでフィットすると過学習が起こり、分散が大きくなります。一方、モデルが単純すぎると過小適合となり、バイアスが大きくなります。 直線(過小適合)と高次多項式(過学習)を、同一の基底二次関数にガウスノイズを加えた異なるサンプルにフィットさせる図で直感を構築します。 直線は曲線を体系的に外れ(高バイアス)ますが、高次多項式は各トレーニングセットに完全にフィットするものの、セット間で大きく揺れ動き(高分散)ます。 これらの図が、形式的なバイアス‑分散トレードオフへの動機付けとなります。
バイアス‑分散分解の数学的導出
期待二乗損失を展開し、トレーニングセットの抽出とテスト点のノイズが独立であることを利用することで、誤差はノイズ (σ²)、バイアス²、分散の3つの項に分解されます。
導出では、テスト点 X を固定し、トレーニングセット S を抽出し、仮説 h(S) を学習し、続いて新たなテスト点 (X, Y) を抽出します。ここで Y = h★(X) + ε、ε ∼ N(0, σ²) とします。期待損失 E[(h(S)(X) − Y)²] を展開すると、ε の平均がゼロで h(S) と独立であるため交差項は消えます。長期平均予測子 h̄(X) = E_S[h(S)(X)] を加減すると、次が得られます:
E[(h(S)(X) − Y)²] = σ² + E[(h̄(X) − h★(X))²] + E_S[(h(S)(X) − h̄(X))²]
第一項は避けられないノイズ、第二項は二乗バイアス(平均予測が真の関数からどれだけ離れているか)、第三項は分散(トレーニングセット間で予測がどれだけ変動するか)です。この分解は任意の仮説クラスに対して成り立ち、モデルの複雑さを分析する基礎となります。
分散削減のための正則化
リッジ回帰は最小二乗目的に L2 ペナルティを加え、バイアスのわずかな増加と引き換えに分散を大幅に削減します。
設計行列 XᵀX が条件が悪い、あるいは特異な場合、普通の最小二乗法はデータのわずかな変化が解を大きく揺らすため、分散が非常に大きくなることがあります。 リッジ回帰は次を解きます θ̂ = argmin_θ ‖y − Xθ‖² + λ‖θ‖² λ > 0 のもとで。 ペナルティは θ をゼロに近づけ、解を安定化させます。XᵀX の固有基底では、各固有値 λ_i が λ_i + λ にシフトされ、いずれの固有値もゼロになることを防ぎ、θ̂ の分散を上限付けます。バイアスは若干増加しますが、これは解が無バイアスの最小二乗推定から引き離されるためです。しかし分散は劇的に減少し、特に λ_i が非常に小さい場合に顕著です。このバイアス‑分散トレードオフが、実際に正則化がテスト誤差を改善する理由です。
現代的な展開: ダブルデセントとロバスト性
古典的なU字型のバイアス‑分散曲線を超えて、現代の過剰パラメータ化モデルはダブルデセントと分布シフトに対する予想外のロバスト性を示します。
講師は、古典理論では補間閾値(モデル容量がトレーニング点数を超える)を超えるとテスト誤差は上昇すると予測されると指摘します。しかし、最近の研究(例: Misha Belkin らによるダブルデセント論文)では、過度に過剰パラメータ化された領域ではテスト誤差が再び減少することが示されており、これをダブルデセントと呼びます。直感的には、ゼロ損失解が多数存在し、最適化手法(例: 勾配降下)の暗黙のバイアスが滑らかで汎化性能の高い解を選択するためです。
さらに、データセットシフトに対するロバスト性も検討されています。ImageNet V2 論文(その上級著者の一人と議論した)では、ImageNet テストセットを新しい画像で再構築しました。すべてのモデルの精度はちょうど 11 ポイント低下しましたが、相対的な順位は変わりませんでした。この一定のシフトは、元のテストセットと V2 セットが体系的に異なる(例: 重み付けやカメラ特性)ことを示唆しますが、元で良好だったモデルは V2 でも良好であり、適応的過学習(テストセット情報が訓練に漏れること)がこれら大規模ビジョンモデルでは大きな懸念ではないことを示しています。
モデル選択: クロスバリデーションとハイパーバンド
クロスバリデーションはテストセットを汚染せずにハイパーパラメータの性能を推定し、ハイパーバンドは有望な構成に計算資源を効率的に割り当てます。
ハイパーパラメータ(例: リッジペナルティ λ)を選択するには、最終テストセットを汚染しない検証信号が必要です。ホールドアウト(dev)セットはこの目的に使えますが、データが無駄になります。K‑フォールドクロスバリデーションはトレーニングデータを K 個に分割し、K−1 個で学習し、残りのフォールドで検証し、どのフォールドをホールドアウトするかを回転させます。これにより、すべてのデータがある時点でトレーニングに使用され、汎化性能の低バイアス推定が得られます。
各候補モデルの学習が高コストの場合、ハイパーバンドは効率を向上させます。すべての構成を少数ステップで評価し、下位半分を除外し、残存構成の学習時間を倍にし、1 つの構成が残るまで繰り返します。各ラウンドはほぼ同等の総計算量を消費しますが、性能の良い構成は指数的に多くのリソースを受け取ります。この手法は実装が簡単で、特定の単調性仮定の下で強い理論的保証があり、ハイパーパラメータ探索に必要なフルトレーニング回数を削減します。
これらのツール—バイアス‑分散分析、正則化、ダブルデセントといった現代的洞察、そして実用的なモデル選択アルゴリズム—は、有限かつノイズのあるデータから汎化できるモデルを構築するための統合的なフレームワークを形成します。