스탠퍼드 CS229 머신러닝 스프링 2026 강의 1 소개
과정 개요 및 철학
스탠퍼드 CS229는 프로그래밍보다는 머신러닝의 기초에 초점을 맞춘 수학적으로 심도 있는 과정입니다. 커리큘럼은 학생들이 알고리즘과 코드의 내부 작동 원리를 이해할 수 있도록 수학적 모델링, formulations, derivations에 중점을 둡니다.
사전 지식 및 지원
과정을 성공적으로 이수하려면 확률과 선형대수학 배경이 필요합니다. 특정 기초 지식이 부족한 학생들을 위해, 해당 과목은 섹션과 금요일 TA 강의를 통해 지원을 제공하여 기초를 따라잡을 수 있도록 돕습니다.
AI 도구 정책
AI 도구는 '인간 또는 초인간 협력자'로 허용되지만, 엄격한 제한이 적용됩니다: 학생들은 AI 도구의 결과를 직접 제출물에 복사할 수 없습니다. 이 정책은 학생들이 단순히 에이전트를 구축하여 자료를 이해하는 것이 아니라 자신의 두뇌와 시냅스를 '훈련'하도록 보장하기 위해 설계되었습니다.
머신러닝 정의
분야의 급속한 발전에도 불구하고, 머신러닝의 전통적인 정의는 근본적으로 정확합니다. 이 과정은 두 가지 주요 역사적 정의를 인용합니다:
- 1959 정의: 머신러닝은 컴퓨터에게 명시적으로 프로그래밍하지 않고도 학습할 수 있는 능력을 제공하는 연구 분야이다.
- 1998 (Tom Mitchell) 정의: 컴퓨터 프로그램은 일부 작업 클래스(T)와 성능 측정치(P)에 대한 경험(E)으로부터 학습한다고 말하며, 이는 T에서의 작업 성능이 P로 측정될 때 경험 E가 증가함에 따라 향상된다는 것을 의미한다.
구성 요소의 현대적 해석
- 경험 (E): 이제 합성 데이터, 사고 토큰, 웹 데이터, 인간 레이블 데이터 등을 포함하여 더 넓은 범위의 데이터를 포괄합니다.
- 작업 (T): 작업이かつて 특정적이었음(예: 이미지 분류 또는 가격 예측)과 달리, 현대 모델은 범용이며 동시에 수백만 개의 작업을 해결할 수 있습니다.
- 성능 측정치 (P): 이는 학습 과정을 이끄는 목표(예: 정확도)로 남아 있으며, 학습은 E가 증가함에 따라 P의 향상으로 정의됩니다.
머신러닝 기법의 분류
분야가 너무 빠르게 변화하여 분류에 대한 보편적 합의를 이루기 어렵지만, 이 과정은 머신러닝을 세 가지 주요 패러다임으로 구성하며, 이는 범용 에이전트를 구축하는 도구로 자주 사용됩니다.
지도 학습
지도 학습은 레이블이 붙은 데이터를 사용하여 입력(X)으로부터 출력(Y)을 예측하는 것을 포함합니다.
- 회귀: 출력이 연속 변수일 때(예: 평방 피트를 기반으로 집 가격 예측).
- 분류: 출력이 이산 변수 또는 태그일 때(예: 이미지에 플라밍고 또는 고양이가 포함되어 있는지 식별).
대형 언어 모델(LLMs)은 근본적으로 분류 문제이며, 다음 토큰을 예측하는 것은 50,000에서 250,000개의 옵션으로 구성된 어휘에서 하나의 이산 레이블을 선택하는 것을 포함합니다.
비지도 학습
비지도 학습은 입력은 있지만 해당 레이블이 없는 데이터에서 흥미로운 구조나 패턴을 찾는 것을 목표로 합니다.
- 클러스터링: 유사한 데이터 포인트를 함께 그룹화합니다(예: 질병을 식별하기 위해 유전자 발현을 그룹화하거나 주제별로 문서를 클러스터링).
- 임베딩: 단어 또는 개념을 고차원 벡터로 표현하여 거리와 방향이 의미적 관계를 나타내도록 합니다(예: 수도 도시와 그 나라 사이의 벡터 관계).
- 생성 모델: 라벨이 없는 데이터를 사용하여 새로운 현실적인 콘텐츠를 생성합니다(예: 이미지 생성을 위한 확산 모델).
강화 학습 (RL)
강화 학습은 행동이 미래 상태에 영향을 미치는 순차적 의사결정에 초점을 맞춥니다.
- 전통적 RL: 로봇공학(걷기 배우기) 또는 게임(AlphaGo)에서 사용되며, 에이전트는 시도와 오류를 통해 학습합니다.
- LLM을 위한 현대적 RL: 텍스트 생성 중 확률적 샘플링을 처리하는 데 사용됩니다. 샘플링은 미분 가능한 연산이 아니므로, 정책 그래디언트와 같은 RL 기법을 보상(인간 피드백 또는 보상 모델)에 기반하여 모델을 업데이트하는 데 사용됩니다.
- 부트스트래핑: RL은 상호작용적 데이터 수집을 허용합니다. 예를 들어, 자동 정리 증명에서 모델이 증명을 생성하고, 올바른 증명은 검증되어 훈련 세트에 다시 추가되어 자기 개선 루프를 만듭니다.
추가 과정 주제
핵심 패러다임을 넘어, 이 과정은 다음 주제를 다룰 것입니다:
- 딥 러닝: 백만 또는 억 개의 매개변수를 가진 신경망을 사용하여 뇌와 유사한 시냅스를 시뮬레이션하며, 손실 함수와 역전파를 통해 훈련됩니다.
- ML 시스템: 효율을 최적화하기 위한 소프트웨어와 하드웨어의 교차점입니다. 알고리즘 속도를 심지어 20%만 향상시켜도 frontier labs에 massive 비용 절감과 더 빠른 개발 주기를 가져올 수 있습니다.
- 사회적 영향: AI의 공정성과 사회적 결과, 특히 고용 시장에 미치는 영향을 탐구하는 계획된 연구입니다.