Stanford CS229 Spring 2026 Lecture 16: 트랜스포머 어텐션 변형, 전문가 혼합, 및 인-컨텍스트 학습
트랜스포머 어텐션 요약
강의는 기본 트랜스포머 어텐션 메커니즘을 상기시키며 시작됩니다. 단일 헤드에 대해, 쿼리 Q, 키 K, 값 V는 각 행이 시간 단계에 해당하는 행렬입니다. 어텐션 점수는 QKᵀ을 얻어 자기회귀 행동을 강제하기 위해 마스킹한 후, 행별 소프트맥스를 적용하고 V와 곱합니다. 결과는 값의 가중 합입니다. 여러 헤드를 사용할 때, 각 헤드는 서로 다른 가중치를 가지지만 동일한 구조의 자신만의 Q, K, V 행렬을 가집니다.
그룹 쿼리 어텐션
추론 중 키-값(KV) 캐시의 메모리 사용량을 줄이기 위해, 강의는 그룹 쿼리 어텐션(GQA)을 설명합니다. 각 헤드마다 별도의 키와 값 벡터를 저장하는 대신, GQA는 여러 쿼리 헤드에 걸쳐 더 작은 키와 값 세트를 공유합니다. 각 쿼리 헤드는 결정적 매핑(예: floor((j‑1)/tall)+1)을 통해 키 그룹에 할당됩니다. 어텐션 계산은 그룹 내 모든 쿼리에 대해 공유된 키를 사용하면서, 각 헤드는 여전히 자체 출력을 생성합니다.これにより 저장된 키/값 벡터의 수가 헤드 수 NH에서 키 그룹 수 NG로 줄어들어(여기서 NH는 헤드 수, NG는 키 그룹 수를 의미함) GPU 메모리 사용량이 감소하고 더 큰 배치 크기를 허용합니다.
슬라이딩 윈도우 어텐션
강의는 슬라이딩 윈도우 어텐션을 완전 어텐션의 2차 연산 비용을 줄이는 방법으로 소개합니다. 각 쿼리가 모든 이전 키에 참석하도록 허용하는 대신, 각 쿼리는 고정된 윈도우 크기 W인 가장 최근의 W개 키에만 참석합니다.これにより 복잡도는 O(T²)에서 O(T·W)로 변경됩니다. 최상위 레이어 어텐션은 최근 토큣으로 제한되지만, 더 깊은 레이어는 이전 토큰의 정보를 간접적으로 전파할 수 있어, L 레이어에 대해 효과적인 수용 영역이 약 L·W 토큰 정도가 됩니다. trade‑off는 장기 의존성이 감소하는 반면 연산과 메모리 사용량이 낮아진다는 점입니다.
전문가 혼합
다음으로, 강사는 연산 증가 비례 없이 모델 파라미터 수를 늘리는 방법으로서 전문가 혼합(MoE) 계층을 다룹니다. MoE 계층은 많은 전문가 네트워크(보통 피드‑포워드 네트워크)와 각 토큰에 대해 소수의 전문가를 선택하는 라우팅 모듈로 구성됩니다. 예를 들어, 총 128명의 전문가와 상위‑2 라우팅이 있을 때, 각 토큰당只有 2명의 전문만이 활성화되어 활성 파라미터 수가 전체보다 훨씬 작게 됩니다. 라우팅은 일반적으로 학습된 투영에 이어 소프트맥스 또는 시그모이드를 기반으로 하며, 선택된 전문가들의 출력은 가중 합을 통해 결합되고, 합이 1이 되도록 재정규화됩니다. 공통 지식을 포착하기 위해 항상 활성화되는 공유 전문가를 포함할 수도 있습니다. 동기는 계산 효율성뿐 아니라 전문가가 서로 다른 언어 현상에 특화되기를 바라는 것이지만, 이러한 특화는 명시적 감독이 아닌 엔드‑투‑엔드 훈련에서 암시적으로 발생합니다.
인-컨텍스트 및 제로샷 학습
강의는 그래디언트 업데이트 없이 대형 언어 모델을 새로운 작업에 적응시키는 방법을 설명합니다. 인-컨텍스트 학습은 시연 예시(입력‑출력 쌍)를 테스트 입력과 연결하고 모델이 답변을 생성하도록 허용하는 것을 의미합니다. 제로샷 학습은 작업 설명만 제공(예: "classify emails into billing or technical))하고 예시를 제공하지 않는 방식으로 더 나아갑니다. 모델은 사전 훈련된 지식을 의존하여 올바른 행동을 추론합니다. 이러한 접근 방식은 모델이 프롬프트를 컨텍스트로 간주하고 시연된 패턴과 일치하거나 지시를 따르는 연속을 생성하기 때문에 작동합니다.
인스트럭션 튜닝 (지도형 파인튜닝)
마지막으로, 강사는 제로샷과 인-컨텍스트 능력을 강화하는 방법으로서 인스트럭션 튜닝을 설명합니다. 지시‑출력 쌍(X, Y)로 구성된 데이터셋이 수집되며, 여기서 X는 작업 설명이고 Y는 원하는 응답입니다. 그 후, 모델은 표준 언어 모델 손실(주어진 X에 대한 Y의 음수 로그 우도)을 사용하여 이 데이터셋에서 추가 훈련을 받습니다. 이 지도형 파인튜닝은 아키텍처를 변경하지 않으며, 프롬프트 시에 지시를 따르고 적절한 출력을 생성하도록 모델의 파라미터를 조정합니다.その結果 모델은 제로샷 및 few‑shot 작업 모두에서 성능이 향상됩니다.