Stanford CS229 Spring 2026 Lecture 4: 지수 패밀리, GLM, Softmax

Stanford CS229 Spring 2026 Lecture 4: 지수 패밀리, GLM, Softmax

지수 패밀리는 많은 일반적인 분포들을 포괄하는 단일 함수 형태를 제공하여, 특정 분포에 관계없이 동일한 유도 과정을 통해 추론 및 학습을 수행할 수 있게 합니다. 이는 로지스틱 회귀, 소프트맥스 다중 클래스 분류, 그리고 현대 신경망의 최종 층과 같은 널리 사용되는 모델들의 기반이 되기 때문에 중요합니다.

지수 패밀리 형태와 동기

확률 분포가 지수 패밀리에 속하려면 exp(ada^T * t(y) - a(ada) + b(y)) 형태로 표현될 수 있어야 하며, 여기서 ada는 자연 매개변수, t(y)는 충분 통계량, a(ada)는 로그 파티션 함수, b(y)는 ada에 의존하지 않는 기본 측정값입니다. 이 형태는 정규화가 a(ada)에 의해 처리되도록 보장하여 분포가 1이 되도록 합니다.

예시: 베르누이와 가우시안

평균 φ를 갖는 베르누이 변수 y ∈ {0,1}에 대해 충분 통계량 t(y)는 y이며, 자연 매개변수 ada는 log(φ/(1−φ))이고, 로그 파티션 함수 a(ada)는 log(1+exp(ada))이며, b(y)는 0입니다. 분산이 알려진 가우시안의 경우, t(y)는 y, ada는 μ/σ², a(ada)는 μ²/(2σ²)와 상수항을 더한 형태이며, b(y)에는 이차 항 −y²/(2σ²)가 포함됩니다. 두 예시 모두 제시된 형태에 맞습니다.

주요 특성: 로그 파티션 함수가 기대값과 분산을 제공

로그 파티션 함수 a(ada)를 ada에 대해 미분한 1차 도함수는 충분 통계량 t(y)의 기대값과 같습니다. 2차 도함수는 t(y)의 분산과 같습니다. 이는 지수 패밀리의 모든 분포에 적용되므로, 로그 파티션 함수를 알면 기대값과 분산을 별도의 순간 계산 없이 "무료"로 얻을 수 있습니다.

일반화 선형 모델 (GLM) 프레임워크

지도 학습에서는 p(y|x;θ)를 지수 패밀리 분포를 선택하여 모델링하며, 이때 자연 매개변수 ada를 θ^T x와 동일하게 설정합니다. 예측 출력 h_θ(x)는 x가 주어졌을 때 t(y)의 기대값이며, 이는 a(ada)를 미분함으로써 얻습니다. 학습은 데이터의 로그 가능도를 최대화함으로써 진행되며, 충분 통계량이 항등 함수일 경우 θ ← θ + (y − h_θ(x)) x 형태의 경사 상승 업데이트로 표현됩니다.

Softmax와 다중 클래스 분류

y가 원-핫 벡터로 인코딩된 이산 클래스 레이블일 때, 충분 통계량은 y 자체이며 자연 매개변수 ada는 각 클래스 j에 대한 점수 θ_j^T x의 벡터입니다. 로그 파티션 함수 a(ada)는 log(∑_j exp(θ_j^T x))입니다. 결과 분포는 softmax이며: p(y=j|x) = exp(θ_j^T x) / ∑_k exp(θ_k^T x). 이는 신경망에서 사용되는 다중 클래스 분류 모델과 정확히 동일합니다.

로지스틱 회귀와의 연결 (K=2 경우)

두 클래스인 경우 softmax는 로지스틱 회귀로 축소됩니다. 확률의 합이 1이어야 하므로 점수 하나만 자유롭습니다; θ = θ_1 − θ_2 로 정의하면 두 클래스 softmax가 σ(θ^T x) = 1/(1+exp(−θ^T x)) 형태로 축소되며, 이는 로지스틱 함수입니다.

학습: 최대 가능도, 교차 엔트로피, 경사 하강법

softmax 모델의 로그 가능도를 최대화하면 교차 엔트로피 손실이 얻어집니다: −∑_j y_j log(p_j), 여기서 y_j는 원-핫 레이블입니다. 이 손실에 대한 확률적 경사 하강법은 파라미터를 θ ← θ + (y − p) x 로 업데이트하며, 여기서 p는 softmax 확률 벡터입니다. 이 업데이트 규칙은 올바른 클래스의 점수를 높이고 잘못된 클래스의 점수를 낮추는 직관과 일치합니다.

라벨 스무딩 직관

라벨 스무딩은 강한 원-핫 목표를 잘못된 클래스에 작은 확률을 부여하는 분포로 대체합니다. 이는 모델이 과도하게 자신감 있게 되는 것을 방지하고, 정규화 역할을 하며, 노이즈가 있는 레이블에 대해 학습을 더 견고하게 만듭니다. 동일한 교차 엔트로피 식이 부드러워진 목표에도 적용됩니다.

실용적인 참고 사항: 구현 및 수치 안정성

실제로 라이브러리들은 지수 함수를 적용하기 전에 최대 점수를 빼는 방식으로 softmax를 수치적으로 안정되게 계산합니다. 기본 수학은 동일합니다: 점수를 지수화하고, 그 합으로 정규화하여 합이 1이 되는 확률 분포를 얻습니다. 이러한 연산은 텍스트를 토큰 단위로 생성하는 시스템을 포함한 대부분의 최신 AI 시스템에서 최종 층으로 사용됩니다.

SUMMARY: Stanford CS229 Spring 2026 Lecture 4에서는 지수 패밀리를 분포들을 통합하는 프레임워크로 소개하며, 이것이 일반화 선형 모델에 대한 추론 및 학습을 가능하게 하고 softmax 다중 클래스 분류의 기반이 됨을 보여줍니다.

TITLE: Stanford CS229 Spring 2026 Lecture 4: 지수 패밀리, GLM, Softmax

Sources