가우시안 혼합 모델과 주성분 분석을 위한 EM 알고리즘 – Stanford CS229 강의 10 (2026년 봄)

가우시안 혼합 모델을 위한 EM 알고리즘

EM 알고리즘은 로그‑우도(log‑likelihood)에 대한 하한을 반복적으로 구성하고 최대화함으로써 가우시안 혼합 모델을 fitting하는 원칙적인 방법을 제공합니다.

E‑단계: 젠센 부등식을 통한 하한 구성

E‑단계는 현재 매개변수에서 tight한 surrogate 함수를 구성하고, 다른 곳에서는 실제 로그‑우도보다 낮게 유지합니다. 각 데이터 포인트에 대해 잠재 변수 Z에 대한 분포 Q를 도입합니다. 로그‑우도를 Q에 대한 기대로 표현하고, 오목한 log 함수에 젠센 부등식을 적용하여 하한을 얻습니다. 이 하한은 Q가 사후 분포 P(Z|X,θ)로 선택될 때 tight해집니다. 즉, 현재 매개변수 추측에 대한 각 구성 요소의 조건부 확률입니다. 이 선택은 현재 θ에서 surrogate가 실제 우도와 접촉하도록 만들고, surrogate를 최대화함으로써 실제 우도가 감소하지 않음을 보장합니다.

M‑단계: 평균, 공분산, 혼합 비율 업데이트

E‑단계로부터의 책임(responsibility)을 바탕으로, M‑단계는 기대 완전 데이터 로그‑우도를 최대화하며, 이는 가우시안에 대한 가중 최대우도 추정으로 축소됩니다.

  • 구성 요소 j의 평균은 데이터 포인트의 책임 가중 평균으로 업데이트됩니다.
  • 구성 요소 j의 공분산은 새로운 평균 주변의 책임 가중 두 번째 중심 모멘트로 업데이트됩니다.
  • 혼합 비율 π_j는 구성 요소 j에 대한 평균 책임으로 업데이트됩니다(일반적으로 라그랑주 승수를 사용하여 합이 1이 되도록 보장합니다). 이 업데이트는 surrogate의 도함수를 0으로 설정하여 얻습니다.

K‑평균과의 연결 및 단조 수렴

가우시안 혼합 모델에 대한 EM은 K‑평균을 일반화합니다: K‑평균은 하드 할당을 사용하고 평균만 업데이트하는 반면, EM은 소프트 책임을 사용하고 또한 공분산과 혼합 가중치를 추정합니다. surrogate가 현재 매개변수에서 tight하고 오목하기 때문에, 각 EM 반복은 실제 로그‑우도를 증가시키거나 unchanged 상태로 유지하며, 이는 지역 최대점 또는 안장점으로의 단조 수렴을 보장합니다.

주성분 분석(PCA)

PCA는 중심화된 데이터에서 가장 큰 분산을 포착하는 직교 방향을 찾아 저차원 표현을 제공합니다.

중심화, 스케일링, 및 분산 최대화 관점

먼저, 평균을 빼서 데이터를 중심화하면 첫 번째 주성분이 원점 주변의 퍼짐 방향을 설명합니다. 선택적으로, 각 특징을 단위 분산으로 스케일링하여 원시 스케일이 큰 특징이 분산 기준을 지배하지 않도록 방지할 수 있습니다. 중심화 후, PCA는 투영된 데이터의 분산을 최대화하는 단위 벡터 u를 찾으며, 이는 수직 잔차의 제곱 합을 최소화하는 것과 동등합니다.

고유분해 해석 및 구성 요소 선택

최대화 문제는 경험 공분산 행렬(XᵀX/(n‑1))의 고유값 문제로 축소됩니다. 고유벡터는 주성분이 되며, 관련된 고유값은 각 구성 요소가 설명하는 분산과 같습니다. 고유값은 감소하는 순서로 정렬되므로, 첫 번째 고유벡터는 최대 분산 방향을, 두 번째 고유벡터는 다음 직교 방향의 최대 잔여 분산을 제공하고, 이와 같이 계속됩니다. 상위 k개의 고유벡터에 데이터를 투영하면 가장 많은 분산을 유지하는 k차원 표현을 얻습니다.

실제적인 주의사항 및 PCA가 실패할 때

PCA는 관심 있는 방향이 공분산 행렬의 잘 분리된 고유값에 해당한다고 가정합니다. 고유값이 가까우면 추정된 고유벡터가 불안정해져 새로운 데이터에서 다른 구성 요소가 나타날 수 있습니다. 이 방법은 또한 결측값을 처리하지 못합니다; 결측 데이터는 미리 보간하거나 제거해야 합니다. 마지막으로, PCA는 분산을 보존하는 것이 목표일 때만 적절합니다; 예측 신호가 낮은 분산 방향에 있다면 PCA는 유용한 정보를 버릴 수 있습니다.

Sources