스탠포드 CS229 2026年春 학기 6강: 편향-분산 트레이드오프, 정규화, 더블 디센트, 그리고 하이퍼밴드
편향-분산 트레이드오프: 핵심 개념과 동기
편향-분산 분해는 예상 테스트 오류를 irreducible noise(제거할 수 없는 노이즈), squared bias(제곱 편향), variance(분산)의 합으로 표현합니다.
이 강의는 중심적인 머신러닝 질문을 제시하면서 시작합니다: 유한한 노이즈가 있는 샘플이 주어졌을 때, 어떻게 일반화되는 모델을 선택할 수 있을까요? 과적합은 모델이 지나치게 표현력이 높아 노이즈에 맞춰져서 높은 분산을 초래할 때 발생합니다. 과소적합은 모델이 지나치게 간단해서 높은 편향을 초래할 때 발생합니다. 직관은 동일한 기본 2차 함수에 가우시안 노이즈를 더한 다양한 샘플에 직선(과소적합)과 고차 다항식(과적합)을 fitting하는 그림을 통해 구축됩니다. 직선은 곡선을 체계적으로 놓치게 되어(높은 편향) 발생하고, 고차 다항식은 각 훈련 세트에 완벽히 맞지만 세트 간에 크게 변동하여(높은 분산) 발생합니다. 이러한 그림들은 형식적인 편향-분산 트레이드오프를 동기부여합니다.
편향-분산 분해의 수학적 유도
예상 제곱 손실을 확장하고 훈련 세트 추출과 테스트 포인트 노이즈의 독립성을 이용하면 오류는 세 항목으로 분해됩니다: 노이즈(σ²), 제곱 편향(bias²), 그리고 분산.
유도는 테스트 점 X를 고정하고, 훈련 세트 S를 추출하고, 가설 h(S)를 학습한 후, 새로운 테스트 점 (X, Y)를 추출하는데 여기서 Y = h★(X) + ε이고 ε ∼ N(0, σ²)입니다. 기대 손실 E[(h(S)(X) − Y)²]를 전개하면, 교차 항은 ε의 평균이 0이고 h(S)와 독립이므로 사라집니다. 장기 평균 예측값 h̄(X) = E_S[h(S)(X)]을 더하고 빼면 다음과 같이 됩니다:
E[(h(S)(X) − Y)²] = σ² + E[(h̄(X) − h★(X))²] + E_S[(h(S)(X) − h̄(X))²]
첫 번째 항은 피할 수 없는 노이즈이고, 두 번째 항은 제곱 편향(평균 예측이 실제 함수로부터 얼마나 멀리 있는지를 나타냄)이며, 세 번째 항은 분산(훈련 세트 간에 예측이 얼마나 변동하는지를 나타냄)입니다. 이 분해는 어떤 가설 클래스에도 성립하며 모델 복잡도를 분석하는 기초가 됩니다.
분산을 줄이기 위한 정규화
릿지 회귀는 최소 제곱 목적 함수에 L2 페널티를 추가하여 편향의 소폭 증가와引? Actually we say: 편향의 소폭 증가를 대가로 분산을 크게 감소시킵니다.
설계 행렬 XᵀX가 조건이 나쁘거나 특이행렬일 때, 일반 최소 제곱은 데이터의 작은 변화가 해에 큰 변동을 일으켜 엄청난 분산을 가질 수 있습니다. 릿지 회귀는 다음을 풀어줍니다:
θ̂ = argmin_θ ‖y − Xθ‖² + λ‖θ‖² with λ > 0.
이 페널티는 θ를 0쪽으로 shrinkage시켜 해를 안정화시킵니다. XᵀX의 고유기저에서 각 고유값 λ_i는 λ_i + λ로 이동되어 어떤 고유값도 0이 되는 것을 방지하고 따라서 θ̂의 분산을 제한합니다. 해가 편향되지 않은 최소 제곱 추정치에서 멀어지기 때문에 편향이 약간 증가하지만, 특히 일부 λ_i가 매우 작을 때 분산이 크게 감소합니다. 이 편향-분산 트레이드오프가 실제 상황에서 정규화가 테스트 오류를 개선하는 이유입니다.
현대적 변형: 더블 디센트와 robustness
클래식한 U자형 편향-분산 곡선을 넘어, 현대적인 과매개변수 모델은 더블 디센트와 분포 이동에 대한 예외적인 robustness를 보입니다.
강사는 고전적 이론이 보간 임계값(모델 용량이 훈련 포인트 수를 초과하는 지점) 이후 테스트 오류가 반드시 상승해야 한다고 예측한다고 언급합니다. 그러나 최근 연구(예: Misha Belkin et al.의 더블 디센트 논문)에 따르면, heavily overparameterized 영역에서는 테스트 오류가 실제로 다시 감소할 수 있는데,これを 더블 디센트 현상이라고 합니다. 직관적으로는 많은 제로‑loss 해가 존재하며, 옵티마이저(예: 경사 하강법)의 암묵적 편향이 부드러운 해를 선택하여 일반화 성능이 좋은 모델을 만든다는 것입니다.
또한, 데이터셋 이동에 대한 robustness가 조사되었습니다. ImageNet V2 논문(한 명의 저자 senior와 논의됨)은 새로운 이미지로 ImageNet 테스트 세트를 재구성했습니다. 모든 모델의 정확도가 정확히 11포인트 떨어졌지만, 상대적인 순위는 동일하게 유지되었습니다. 이 일정한 이동은 원래 테스트 세트와 V2 세트가 체계적인 방식으로 차이가 난다는 것을 시사합니다(예: 가중치 또는 카메라 특성). 그러나 원래에서 잘 수행된 모델이 V2에서도 잘 수행된 사실은 적응적 과적합(훈련에 테스트 세트 정보 유출)이 이러한 대규모 비전 모델에서는 주요 문제가 아님을 나타냅니다.
모델 선택: 교차 검증과 Hyperband
하이퍼파라미터(예: 릿지 페널티 λ)를 선택하기 위해서는 최종 테스트 세트를 오염시키지 않는 검증 신호가 필요합니다. 홀드아웃(dev) 세트는 이 목적을 달성하지만 데이터를 낭비합니다. K‑폴드 교차 검증은 훈련 데이터를 K개의 폴드로 나누고, K−1개의 폴드로 훈련하고 남은 하나의 폴드로 검증을 수행하며, 어느 폴드가 검증용인지 순환시킵니다.これにより 모든 데이터를 어느 시점에서 훈련에 사용하면서도 편향이 낮은 일반화 추정을 제공합니다.
각 후보 모델의 훈련이 비용이 많이 들 때, Hyperband는 효율성을 높입니다. 그것은 모든 구성을 적은 수의 단계로 평가하고, 성능이 나쁜 절반을 버리며, 남은 구성의 훈련 시간을 두 배로 늘리고, 하나의 구성이 남을 때까지 이 과정을 반복합니다. 각 라운드에서는 대략 동일한 총 컴퓨팅을 사용하지만, 성능이 더 좋은 구성에는 지수적으로 더 많은 자원이 할당됩니다. 이 방법은 구현이 간단하며 특정 단조성 가정 하에 강한 이론적 보장을 제공하고, 하이퍼파라미터 탐색에 필요한 전체 훈련 실행 횟수를 줄입니다.
이러한 도구들—편향-분산 분석, 정규화, 더블 디센트 같은 현대적 통찰, 그리고 실용적인 모델 선택 알고리즘—은 유한하고 노이즈가 있는 데이터로부터 일반화되는 모델을 구축하기 위한 통합된 프레임워크를 형성합니다.