Stanford CS229 Machine Learning Spring 2026 Lecture 2: Supervised Learning Setup
Supervised Learning Setup
지도 학습(Supervised learning)은 레이블이 지정된 훈련 쌍으로부터 가설(hypothesis)을 학습하여 새로운 입력에 대한 출력을 예측합니다. 가설은 입력 공간 X를 출력 공간 Y로 매핑하는 함수 $h$입니다. 훈련 세트는 $x^{(i)} \in X$인 입력 예시와 $y^{(i)} \in Y$인 레이블로 구성된 쌍 $(x^{(i)}, y^{(i)})$로 이루어집니다. 목표는 보지 못한 입력에 대한 예측이 실제 출력과 가깝도록 $h$를 선택하는 것이며, 이러한 성질을 일반화(generalization)라고 합니다.
Regression vs Classification
출력 공간 Y가 실수(real numbers)를 포함하면 문제는 회귀(regression)이며, Y가 유한한 이산 레이블 집합을 포함하면 문제는 분류(classification)입니다. 회귀의 예로는 집값 예측이 있으며, 분류의 예로는 이미지에 고양이가 있는지 또는 개가 있는지 감지하는 것이 있습니다. 강의에서는 chat‑GPT가 다음 단어를 추측하기 위해 분류기 헤드(classifier head)를 사용하여 더 큰 시스템 내부의 분류 구성 요소를 보여준다고 언급합니다.
Linear Hypothesis and Least Squares
선형(affine) 가설은 $h_\theta(x) = \theta^T x$의 형태를 가지며, 여기서 $\theta$는 매개변수 벡터이고 $x_0 = 1$이라는 관례는 절편(intercept) 항을 흡수합니다. 매개변수는 제곱 오차로 측정된 경험적 위험(empirical risk)을 최소화함으로써 선택됩니다. 손실 함수는 $J(\theta) = \frac{1}{2} \sum_{i=1}^n (h_\theta(x^{(i)}) - y^{(i)})^2$입니다. $\theta$에 대한 $J$의 그래디언트를 0으로 설정하면 정규 방정식(normal equations)을 얻으며, 이는 설계 행렬(design matrix)이 특정 조건을 만족할 때 폐쇄형 해(closed‑form solution)를 제공합니다.
Gradient Descent Basics
경사 하강법(Gradient descent)은 그래디언트의 반대 방향으로 $\theta$를 반복적으로 업데이트하여 $J$를 최소화하는 매개변수 벡터를 찾습니다: $\theta \leftarrow \theta - \alpha \nabla J(\theta)$. 단계 크기 $\alpha$는 각 업데이트가 이동하는 거리를 제어합니다. $\alpha$가 너무 크면 업데이트가 최솟값을 지나쳐 진동(oscillation)을 일으킬 수 있고, $\alpha$가 너무 작으면 수렴이 느려집니다. 강의에서는 $\alpha$를 선택하는 것이 실질적인 문제이며, Adam, Adagrad와 같은 적응형 옵티마이저(adaptive optimizers)가 이를 자동으로 조정할 수 있다고 언급합니다.
Stochastic Gradient Descent and Mini‑Batching
확률적 경사 하강법(Stochastic gradient descent, SGD)은 전체 배치(full‑batch) 그래디언트를 무작위로 선택된 훈련 예시의 미니 배치(mini‑batch)에서 계산된 추정치로 대체합니다. 이는 반복당 비용을 $O(n)$에서 $O(\text{batch size})$로 줄여주며 매우 큰 데이터셋에 대한 학습을 가능하게 합니다. 미니 배치는 균등하게 무작위로 추출됩니다; 복원 추출 또는 비복원 추출 모두 실제로는 유사한 동작을 보이지만, 비복원 추출이 구현하기 더 쉬운 경우가 많습니다. 배치는 전체 데이터를 대표해야 합니다. 그렇지 않으면 모델이 샘플링된 하위 집합에 과적합(overfit)될 수 있습니다(예: 고양이만 보다가 개만 보는 경우). 배치 크기에는 트레이드오프가 있습니다: 작은 배치는 노이즈가 있는 그래디언트를 제공하지만 업데이트가 더 빈번하고, 큰 배치는 분산이 낮은 그래디언트를 제공하지만 더 많은 메모리와 계산이 필요합니다. GPU 메모리와 같은 시스템 고려 사항이 실제로는 선택된 배치 크기를 결정하는 경우가 많습니다.
Normal Equations and Linear Algebra
설계 행렬 $X$ (행이 $x^{(i)T}$)가 완전 열 계수(full column rank)를 가질 때, $X^T X$는 역행렬이 존재하며 최소 제곱 해는 $\theta^* = (X^T X)^{-1} X^T y$입니다. 이 해는 정확하며 반복을 필요로 하지 않습니다. 이 유도는 예시의 수 $n$이 특징의 수 $d$(절편 포함)보다 크거나 같다는 것을 가정합니다. $X^T X$는 양의 준정부호(positive semidefinite) 행렬입니다; 역행렬이 존재하려면 양의 정부호(positive definite)여야 합니다. 만약 $X^T X$가 특이 행렬(singular)이면 해는 유일하지 않으며, 손실을 변경하지 않고 영공간(null space)의 임의의 벡터를 $\theta^*$에 더할 수 있습니다.
Practical Advice
학생들은 모델링 전에 데이터를 살펴보아야 합니다. 시각적 검사는 패턴과 데이터 품질 문제를 드러낼 수 있기 때문입니다. 강의에서는 라이브 세션 중에 질문을 하고 금요일 TA 세션을 사용하여 표기법, 미적분학, 선형 대수학을 복습할 것을 권장합니다. 제공된 슬라이드와 강의 노트는 권장되는 리소스입니다; 공동 강사의 노트는 엄격한 학습을 위한 가장 완전한 참조 자료로 설명됩니다.