Stanford CS329A: AI 에이전트를 위한 테스트 타임 컴퓨트 스케일링

테스트 타임 컴퓨트 스케일링 개요

테스트 타임 컴퓨트 스케일링은 모델 파라미터를 변경하거나 추가 파인튜닝 없이 AI 모델의 성능을 향상시킬 수 있습니다. 기존 LLM 개발은 사전 학습(높은 컴퓨팅, 긴 기간)과 파인튜닝(낮은 컴퓨팅)에 초점을 맞추지만, 테스트 타임 스케일링은 컴퓨팅 예산을 추론 단계로 이동시켜 기존 모델로부터 더 나은 응답을 유도합니다.

병렬 샘플링과 커버리지의 파워 법칙

반복적인 병렬 샘플링은 모델에 동일한 입력 문제를 여러 번 제시하고 검증기를 사용하여 올바른 응답을 선택하는 과정입니다. 이 접근 방식은 더 작고 열등한 모델(예: Llama 3-8B)이 특정 작업에서 더 크고 독점적인 모델(예: GPT-4o)을 능가하도록 할 수 있습니다.

추론에 대한 스케일링 법칙

연구에 따르면 커버리지(최소 한 샘플이 문제를 해결한 비율)와 샘플 수(k) 사이의 관계는 지수 파워 법칙을 따릅니다. 이를 통해 엔지니어는 다양한 모델 크기와 도메인에서 특정 커버리지 목표를 달성하기 위해 필요한 자원을 예측할 수 있습니다.

어려운 문제의 긴 꼬리

이 파워 법칙 동작은 문제 난이도의 분포에서 비롯됩니다. 대부분의 문제는 "pass@1"에서 해결되지만, 모델이 드물게만 해결하는 복잡한 문제의 "긴 꼬리"가 존재합니다. 샘플 수를 늘리면 가장 어려운 문제에 대한 이러한 드문 올바른 솔루션에 도달할 확률이 높아집니다.

생성-검증 갭

모델은 종종 큰 샘플 세트 내에서 올바른 답을 생성할 수 있지만, 그 답을 식별하는 능력은 별도의 과제로 known as the generation-verification gap입니다.

검증 가능 도메인 vs. 검증 불가능 도메인

  • 검증 가능 도메인: 코드(단위 테스트를 통해), 수학(형식 증명을 통해), 또는 언어 번역(동등성 검사를 통해)과 같이 완벽하거나 거의 완벽한 검증기가 존재하는 도메인입니다. 예를 들어, CUDA 코드 생성에서는 출력을 소스 PyTorch 코드 출력과 비교하여 검증할 수 있습니다.
  • 검증 불가능 도메인: 자동 검증기가 없는 도메인에서는 다수결 투표(가장 빈번한 답 선택)와 같은 방법이 종종 빠르게 정체되어 어려운 문제에 대한 드문 올바른 답을 포착하지 못합니다. 심지어 LLM 기반 보상 모델도 현재 검증 능력과 모델의 실제 커버리지 사이에 상당한 격차를 남기는 경우가 많습니다.

테스트 타임 컴퓨트 최적화: 병렬 vs. 순차

단순한 반복 샘플링을 넘어, 순차적 수정과 안내된 검색을 통해 컴퓨팅을 확장할 수 있습니다.

순차적 수정

병렬 시도 대신 모델은 초기 접근 방식을 생성하고 이를 반복적으로 수정합니다. 이 순차적 접근 방식은 모델이 문제를 다양한 관점에서 바라보고 논리를 다듬을 수 있게 합니다.

결과 보상 모델 vs. 과정 보상 모델

  • 결과 보상 모델(ORM): 응답의 최종 답변에 점수를 매깁니다.
  • 과정 보상 모델(PRM): 생성 과정의 각 개별 단계에 점수를 매깁니다. PRM은 모델이 단계별 점수를 기반으로 가장 유망한 reasoning 경로만 확장하는 beam search를 안내하는 데 사용될 수 있습니다.

사전 학습 vs. 테스트 타임 스케일링

쉬운 문제와 중간 난이도 문제에 대해서는 테스트 타임 컴퓨팅을 늘리는 것이 사전 학습 토큰을 늘리는 것보다 종종 더 컴퓨팅 효율적입니다. 그러나 가장 어려운 문제들에 대해서는 더 omfatt한 사전 학습을 가진 더 큰 모델이 상당한 테스트 타임 컴퓨트 예산이 있더라도 여전히 성능 우위를 유지합니다.

Archon: 추론 타임 아키텍처 탐색

Archon은 주어진 컴퓨팅 예산에 대한 모델과 기술의 최적 조합을 찾기 위해 베이지안 최적화를 사용하는 프레임워크로, 추론 스케일링을 아키텍처 설계 문제로 취급합니다.

추론 타임 작업

Archon은 다음과 같은 주요 작업을 활용합니다:

  • 생성: 하나 이상의 LLM에서 표준 샘플링.
  • 융합: 여러 후보 응답을 기반으로 단일 최종 답변을 합성하도록 LLM에 요청.
  • 비평가: 응답의 강점과 약점을 설명하기 위해 모델 사용.
  • 순위 매기기: 모델에게 품질 기준으로 후보를 순위 매기도록 요청.
  • 단위 테스트 생성: 솔루션의 정확성을 검증하기 위해 테스트 생성.

Archon의 주요 발견

  • 딥 아키텍처: 비판자, 순위 매기기, 융합기의 여러 층을 쌓아("딥" 추론 아키텍처 생성) 정확도를 크게 향상시킵니다.
  • 성능 향상: 이러한 아키텍처를 최적화함으로써 오픈소스 모델이 프론티어 폐쇄 소스 모델과 동등하거나 이를 초월할 수 있습니다. Archon은 추론, 수학, 코딩 작업에서 GPT-4와 Claude 3.5 Sonnet에 대해 평균 14.1% pass@1 정확도 향상을 보고했습니다.
  • 일반화: 특정 작업에 최적화된 아키텍처는 다양한 벤치마크에서 잘 작동하는 범용 시스템으로도 설계될 수 있습니다.

Sources