CS229 Lecture 3: 가중 최소 제곱 (Spring 2026)

최소 제곱의 확률적 해석

최소 제곱 해는 가우스 노이즈 모델 하에서 최대 우도 추정으로 유도할 수 있다. 각 레이블 y_i가 theta transpose x_i에 오차 epsilon_i를 더한 값이라고 가정하자. 여기서 epsilon_i는 평균이 0이고 분산이 sigma squared인 독립 동일 분포 정규 확률 변수이다. theta가 주어졌을 때 관측 데이터의 우도는 각 epsilon_i에 대한 가우스 밀도의 곱이다. 로그를 취하면 곱이 합으로 바뀌고, theta에 의존하지 않는 상수를 버리면 음의 로그 우도는 잔차 제곱의 합에 비례한다. 따라서 우도를 최대화하는 것은 최소 제곱 손실을 최소화하는 것과 동등하다.

최대 우도 원리

최대 우도 프레임워크는 세 단계로 구성된다: 입력과 파라미터로부터 레이블이 어떻게 생성되는지를 정의하는 확률적 모델을 만들고, 관측된 데이터셋의 우도를 파라미터의 함수로 작성하며, 이 우도를 최대화하는 파라미터 설정을 선택한다(또는 음의 로그 우도를 최소화하는 것과 동일). 이 원리는 일반적이며 특정 분포 가정에 의존하지 않으며, 로지스틱 회귀와 같은 다른 모델에도 재사용할 수 있다.

회귀에서 분류로: 로지스틱 회귀

레이블 y_i가 0 또는 1인 이진 분류에서 최소 제곱을 직접 적용하면 이산 결과를 연속 값에 맞추려고 하기 때문에 결정 경계가 나빠진다. 대신, 시그모이드 링크 함수 G(z) = 1/(1+exp(-z))를 통과한 선형 점수 theta transpose x_i의 함수로서 y_i가 1일 확률을 모델링한다. 이 베르누이 모델 하에서 단일 관측의 우도는 h_theta(x_i)^{y_i} (1‑h_theta(x_i))^{1‑y_i}이다. 데이터셋에 대한 로그 우도는 y_i log h_theta(x_i) + (1‑y_i) log(1‑h_theta(x_i)) 항들의 합이다. 이 로그 우도를 최대화(또는 음의 로그 우도를 최소화)하면 로지스틱 회귀 목표가 얻어진다. 결과 최적화 문제는 볼록하며, 경사 하강법이나 확률적 경사 하강법과 같은 1차 방법으로 풀 수 있다.

최적화: 경사 하강법 vs 뉴턴 방법

경사 하강법(확률적 변형을 포함)은 목적 함수의 기울기와 반대 방향으로 작은 단계만큼 theta를 이동시켜 업데이트한다; 각 반복은 데이터 점 수 N과 특성 수 D에 대해 O(ND)의 비용이 든다. 뉴턴 방법은 두 번째 순서 정보를 사용하며, 두 번째 도함수의 헤시안 행렬을 포함하는 선형 시스템을 풀어 theta를 업데이트한다. 수렴하면 뉴턴 방법은 반복당 훨씬 빠른 진전을 이루어, 종종 한 단계에서 많은 자릿수의 정밀도를 얻는다. 그러나 각 뉴턴 단계는 헤시안을 형성하고 역행렬을 계산해야 하며, 이는 O(ND^2 + D^3) 연산 비용이 들며, N과 D가 커질 경우 금지적이 된다. 따라서 대규모 머신 러닝 환경에서는 반복당 수렴이 느리더라도 확률적 경사 하강법이 선호되며, 뉴턴 방법은 특성 차원이 modeste인 classical 통계 문제에서 여전히 유용하다.

Sources