스탠퍼드 CS329A 자기 개선 AI 에이전트 – 과정 개요 (가을 2025)

스케일링 법칙과 등장하는 능력

이 강의는 모델 파라미터, 훈련 컴퓨팅, 데이터셋 크기를 증가시킬 때 테스트 손실이 일관되게 감소함을 보여주며, 이는 GPT‑2부터 GPT‑4까지의 성능 향상의 기반이 됩니다.

  • 모델 크기가 BERT (~340 M)에서 GPT‑2 (1.5 B), GPT‑3 (175 B), PaLM (540 B) 및 추정 조‑파라미터 GPT‑4로 증가함에 따라 테스트 손실이 감소하여 더 나은 언어 모델을 얻게 됩니다.
  • 더 큰 모델은 few‑shot 및 zero‑shot 학습을 보여줍니다: 모델은 명시적인 파인튜닝 없이 작업 설명이나 몇 가지 예를 따를 수 있습니다.
  • 등장하는 추론은 더 큰 모델에서만 나타납니다; 충분히 큰 모델(예: LaMDA, GPT, PaLM에서 ≥8 B 파라미터)에 대해 chain‑of‑thought 프롬프팅은 수학 및 추론 작업에서의 성능을 향상시킵니다.
  • 이러한 스케일링 트렌드는 instruction tuning 및 인간 피드백으로부터의 강화 학습(RLHF)에 대한 추가 작업을 촉진하여 원시 언어 모델을 사용 가능한 어시스턴트로 변환했습니다.

Instruction Tuning과 인간 피드백으로부터의 강화 학습

Instruction tuning과 RLHF는 기본 모델을 ChatGPT와 같은 시스템으로 변환하는 핵심 단계였습니다.

  • 다음 토큰 예측에 대한 사전 훈련 후, 모델은 고품질 감독 데이터(책, 에세이)에서 파인튜닝되어 일반적인 언어 능력을 향상시킵니다.
  • Instruction tuning은 질문‑답변 쌍(선택적으로 chain‑of‑thought 포함)을 제시하여 모델이 방향을 따르고 답변을 생성하도록 학습시킵니다.
  • RLHF는 모델 출력에 대한 인간 순위를 바탕으로 보상 모델을 구축합니다; 모델은 następnie 이 보상을 최대화하도록 최적화되어 정확성, 도움이 됨, 무해함과 같은 인간 선호도에 출력을 맞춥니다.
  • 사전 훈련 → 고품질 파인튜닝 → instruction tuning → RLHF의 조합은 ChatGPT에서 볼 수 있는 능력을 만들어냈으며, 이는 이전 모델인 GPT‑3를 능가합니다.

추론 시간 스케일링 (Large Language Monkeys)

추론 시간 스케일링은 모델 파라미터를 변경하지 않고 추가적인 잠재력을 발휘할 수 있습니다.

  • Large Language Monkeys 프로젝트는 주어진 문제에 대해 모델의 출력을 반복적으로 샘플링하고 검증기를 사용하여 정답을 선택하는데, 이는 무한 원숭이 정리와 유사합니다.
  • 실험에서는 수학 및 코딩 벤치마크에서 문제당 샘플 수를 1에서 10,000으로 증가시켰습니다; 단일 샘플로는 GPT‑4o보다 약한 모델도 많은 샘플이 허용될 때 이를 능가했습니다.
  • 이는 모델이 단일 그리디 디코드가 드러내는 것보다 더 많이 알고 있음을 보여줍니다; 추론 스케일링(예: 반복 샘플링, 트리 탐색)은 pass‑@k 또는 커버리지 메트릭을 향상시킬 수 있습니다.
  • 이 접근법은 샘플 효율적입니다: modeste한 수의 병렬 샘플이 정답을 산출할 수 있으며, 병렬 생성을 통해 지연 시간을 완화할 수 있습니다.
  • 검증기가 사용할 수 없는 경우, 연구자들은 LLM‑as‑judge 또는 학습된 보상 함수를 탐색하여 피드백을 제공합니다.
  • 추론 시간 스케일링과 합성 데이터 생성을 결합하면 자기 개선 루프가 가능해집니다: 모델은 후보 솔루션을 생성하고, 검증기가 이를 필터링하며, 필터링된 데이터가 모델을 더욱 파인튜닝하는 데 사용됩니다.

LLMs에서 에이전트 워크플로로

이 과정은 단일 턴 챗봇을 넘어 도구 사용, 계획, 자체 수정을 사용하여 다단계 목표를 달성하는 에이전트로 이동합니다.

  • 에이전트는 목표를 유지하고, 행동을 계획하고, 외부 도구(예: 웹 검색, 코드 실행)와 상호작용하며, 피드백을 사용하여 조정을 함으로써 챗봇과 다릅니다.
  • 워크플로 패턴에는 프롬프트 체이닝(서브태스크 시퀀싱), 라우팅(간단 vs. 복잡 경로), 병렬화(다양한 입력에 대한 동시 LLM 호출), 그리고 오케스트레이터‑워커(플래너 LLM이 워커 LLM에 작업을 할당)가 포함됩니다.
  • 검증기(단위 테스트, 규칙 기반 체커)와 비평가(LLM‑as‑judge)는 자체 수정 및 백트래킹을 위한 피드백을 제공합니다.
  • 논의된 예시로는 코딩 지원을 위한 Claude Code와 end‑to‑end 문헌 합성을 위한 깊은 연구 도구가 있으며, 둘 다 위의 패턴에 의존합니다.
  • 효과적인 에이전트는 강력한 계획, 다단계 추론, 그리고 도구 출력 또는 검증기 신호에 따라 단계를 수정할 수 있는 능력이 필요합니다.

과정 로지스틱스

과정 구조, 평가, 기대치는 다음과 같이 정리됩니다.

  • 선수 조건: 머신러닝 기초 및 딥러닝에 대한 편안함(코스 웹사이트에 나열된 대로).
  • 자료: 강의 슬라이드, 읽을거리, 비디오는 Canvas 및 공개 사이트 cs329a.stanford.edu에 게시됩니다.
  • 평가: 세 개의 홈워크(등급의 50 %) 및 코스 프로젝트(등급의 50 %).
  • 홈워크 스케줄 및 마감일은 Canvas에서 확인할 수 있으며, 지정된 정책에 따라 지연일이 허용됩니다.
  • 프로젝트는 개인 또는 최대 4인 팀으로 수행할 수 있으며, API 크레딧이 제공됩니다.
  • 마일스톤: 프로젝트 제안서(10월 초), 중간 발표(제안서로부터 두 주 후), 최종 보고서 및 포스터 세션(12월 12일, 16:00‑18:00).
  • 프로젝트는 연구 지향이어야 합니다(가설 기반, 단순한 앱이 아님); 과거 프로젝트는 컨퍼런스 출판으로 이어졌습니다.
  • 사무실 시간 및 Q&A는 Ed(공개 포럼)와 Gradescope(제출용)를 통해 처리됩니다.
  • 강의 비디오는 결국 YouTube에 게시되어 감사 전용 시청(크레딧 없음)으로 제공됩니다.

Sources