현대 LLM에 대한 다음 토큰 예측자 정신 모델의 불완전성

다음 토큰 예측자 모델의 한계

대규모 언어 모델(LLM)은 추론 시점에서 다음 토큰 예측자로 작동하지만(토큰을 하나씩 출력함), 이 설명은 현대 모델이 어떻게 훈련되는지, 그리고 무엇을 인코딩하는지에 대한 완전한 정신 모델은 아닙니다. "다음 토큰 예측자"라는 명칭은 출력의 메커니즘(추론 루프의 형태)을 정확히 설명하지만, 사후 훈련된 모델의 목표를 포착하지 못합니다.

사전 훈련 vs. 사후 훈련 목표

기본 모델이 학습하는 방식과 사후 훈련된 모델이 강화 학습을 통해 어떻게 진화하는지 사이에는 근본적인 차이가 있습니다.

사전 훈련: 모방과 예측

사전 훈련 기간 동안 모델은 전통적인 다음 토큰 예측자로 작동합니다. 훈련 데이터셋 내 존재하는 시퀀스를 분석하고, 해당 시퀀스에서 실제 다음 토큰이 더 자주 샘플링되도록 파라미터를 조정합니다. 목적은 순수하게 예측하는 것: 모델은 훈련 데이터의 통계적 패턴을 모방하게 됩니다.

사후 훈련: RLVR를 통한 보상 극대화

현대 LLM은 특히 검증 가능한 보상과 함께 강화 학습(RLVR)을 통해 사후 훈련을 undergo합니다. RLVR에서는 모델이 데이터셋에서 "정답" 다음 토큰을 예측할 필요가 없습니다. 대신 모델은 새로운 시퀀스를 생성하며 탐색하고, 그 결과에 따라 보상을 받습니다.

이 패러다임에서는 모델이 특정 토큰을 더 가능하게 만들 이유가 데이터셋에 등장했기 때문이 아니라, 그 토큰을 포함하는 시퀀스가 높은 보상을 가져왔기 때문입니다. 목적은 데이터 내 다음 토큰 예측에서 보상 함수 극대화로 전환됩니다.

체스 비유: 예측 vs. 최적화

모방과 최적화의 차이를 설명하기 위해 두 종류의 체스 시스템을 고려해 봅시다:

  1. 다음 수 예측자: 마스터급 경기 데이터베이스를 기반으로 훈련된 시스템. 주어진 위치에서 마스터가 가장 가능성이 높게 두는 수를 예측합니다. 기존 인간의 플레이만 모방할 수 있습니다.
  2. 보상 극대화자: 이상화된 엔진으로, 모든 가능한 게임을 탐색하여 어떤 위치에서 승리할 확률을 결정합니다. 인간이 그 수를 두었는지 여부와는 무관하게 승리 가능성을 극대화하는 수를 선택합니다.

두 번째 시스템을 "다음 수 예측자"라고 부르는 것은 오해를 불러일으킵니다. 그 목표는 데이터를 예측하는 것이 아니라 게임에서 이기는 것이기 때문입니다.

커뮤니티 관점의 통합

기술 전문가들 사이의 논의는 "다음 토큰 예측자"라는 명칭이 본질적으로 잘못되었는지, 아니면 단지 추상화 수준의 문제인지에 대해 깊은 분열을 보입니다.

모델의 타당성에 대한 주장

일부는 훈련 목표(예: RLVR 또는 사전 훈련)에 관계없이 수학적 연산은 동일하다고 주장합니다: $P(\text{token}k | \text{tokens}{1...k-1})$를 계산하는 것입니다.

"그것을 수행하는 메커니즘은 중요하지 않습니다. 보상 함수를 극대화하기 때문이든, 기울기를 따르기 때문이든, 혹은 다른 어떤 이유든 간에 여전히 다음 토큰을 예측하고 있습니다."

다른 이들은 "다음 토큰 예측자" 모델이 LLM의 일반적인 실패 유형(예: 응답 초기에 잘못된 답변에 고착되어 이전에 출력한 토큰을 스스로 수정할 수 없음)을 설명하는 데 유용하다고 제안합니다.

모델의 타당성에 대한 반론

이 명칭에 반대하는 이들은 종종 LLM의 부상한 능력을 무시하는 데 사용되는 "단순화된 도구"라고 주장합니다. 그들은 토큰 단위 메커니즘에 집중하는 것이, 이러한 예측을 정확하게 하기 위해 형성되어야 하는 복잡한 내부 표현과 "세계 모델"을 무시한다는 점을 강조합니다.

"보잉 777이 단지 회전하는 기계일 뿐이라고 말하는 것과 같습니다. 그리고 그 기계는 단지 날개를 돌려서 날아갑니다. 물론 그렇긴 하지만, 그렇지 않죠. 그렇게 단순화하면 150톤의 고도화된 공학과 물리학을 무시한 셈입니다."

부상과 능동 시스템

일부는 "다음 토큰 예측자"가 기본 구성 요소이지만, 결과적으로 더 복잡한 시스템이 된다고 제안합니다. 이 관점에서는 현대 인공지능은 간단한 규칙(토큰 예측)과 복잡한 상호작용(RLVR, 도구 사용, 재귀 호출)이 결합되어 단순한 예측자라는 레이블을 넘어서는 능력을 창출하는 부상 시스템입니다.

Sources

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch