가우시안 판별 분석 (GDA) – Stanford CS229 2026年春 강의 5

생성형 vs 판별형 모델링

생성형 모델은 P(X, Y)의 공동 분포 또는 동등하게 P(X|Y)와 클래스 사전 확률 P(Y)를 함께 학습하는 반면, 판별형 모델은 조건부 P(Y|X)를 직접 학습합니다. 이 강의에서 Gaussian Discriminant Analysis (GDA)는 강에서 처음 배우는 생성형 알고리즘으로 제시되며, 이전에 본 판별형 모델들(선형 회귀, 로지스틱 회귀)과 대조됩니다.

1차원 및 2차원에서의 가우시안 분포

R^n에서의 다변량 가우시안은 평균 벡터 μ와 공분산 행렬 Σ로 특성화됩니다. 공분산은 대칭이고 양정정이어야 하며,これにより Σ가 명확히 정의된 역행렬을 가지며 모든 고유값이 양수임을 보장합니다. 밀도는 지수 내부에서 항 (x−μ)^T Σ^−1 (x−μ)를 포함하고, 정규화 상수에는 Σ의 행렬식이 포함됩니다. 동일한 확률을 갖는 등고선은 Σ에 의해 방향과 형태가 결정되는 타원입니다.

가우시안 판별 분석 모델

GDA는 각 클래스 k에 대해 특징 X가 클래스별 평균 μ_k를 가지지만 모든 클래스에 공유되는 공분산 Σ를 따르는 가우시안 분포를 따른다고 가정합니다. 클래스 레이블 Y는 사전 확률 π_k = P(Y=k)를 가진 베르누이 변수로 모델링됩니다. 따라서 생성 과정은 다음과 같습니다: 먼저 클래스 사전 확률에 따라 레이블을 추출하고, 그 레이블에 해당하는 가우시안에서 X를 추출합니다.

GDA에 대한 최대 우도 추정

라벨이 붙은 데이터셋이 주어지면, 최대 우도 추정치는 폐형 해를 갖습니다. 클래스 사전 확률은 경험적 빈도로 추정됩니다: π̂k = N_k / N 여기서 N_k는 레이블 k인 샘플의 수입니다. 클래스별 평균은 해당 클래스에 할당된 특징들의 평균입니다: μ̂_k = (1/N_k) Σ{i:y_i=k} x_i. 공유 공분산은 모든 클래스의 산란을 풀어서 추정합니다: Σ̂ = (1/N) Σ_{k} Σ_{i:y_i=k} (x_i − μ̂_k)(x_i − μ̂_k)^T. 이러한 공식은 단순히 세기와 평균만을 포함하므로 반복 최적화가 필요 없습니다.

결정 경계 및 로지스틱 회귀와의 관계

공분산 Σ가 공유될 때, 두 클래스 사이의 로그 우도 비율은 x에 대한 친선 함수로 줄어들므로 GDA의 결정 경계는 초평면(선형)이 됩니다. 각 클래스가 자체 공분산을 가질 수 있게 허용하면 경계가 2차식이 됩니다(2차 판별 분석, QDA). 강의에서는 이 선형 경계가 로지스틱 회귀 모델로도 얻을 수 있음을 언급하며, 이는 데이터에 대한 많은 생성형 가정이 동일한 판별형 형태로 이어짐을 보여줍니다.

이산 특징에 대한 나이브 베이즈

이진 단어 존재 특징에 대해, 나이브 베이즈는 클래스 조건 하에서 특징들이 조건부 독립이라고 가정합니다. 이 가정으로 인해 특징 수에 지수적으로 증가하던 매개변수 수가 선형으로 줄어듭니다: 각 클래스당 각 특징당 하나의 베르누이 매개변수에 클래스 사전 확률을 더한 형태가 됩니다. 최대 우도 추정치는 각 클래스 내 각 단어의 경험적 빈도이며(0 확률을 피하기 위해 라플라스 스무딩을 사용합니다). 결과적으로得られる 분류기는 학습 및 평가가 저렴하며, 스팸 필터링과 같은 작업에 대한 간단한 생성형 기준이 됩니다.

Sources