LeapLabTHU/limit-of-RLVR

repo for paper https://arxiv.org/abs/2504.13837

해결하는 문제

이 프로젝트는 검증 가능한 보상(Verifiable Rewards)을 사용한 강화학습(RLVR)이 대규모 언어 모델(LLM)의 본질적인 추론 능력을 실제로 향상시키는지, 아니면 단지 기존 지식에 접근하는 효율만 개선하는지 조사합니다. RL로 훈련된 모델이 기본 모델이 해결할 수 없는 문제를 진정으로 해결할 수 있는지, 아니면 단지 샘플링을 통해 정답을 더 효율적으로 찾는 것인지에 대한 이해 부족을 메우는 데 초점을 맞춥니다.

작동 방식

연구팀은 pass@k 지표를 사용하여 모델을 평가합니다. 문제를 해결하기 위해 모델에게 주어지는 시도 횟수(k)를 늘림으로써 모델의 "추론 경계"를 파악할 수 있습니다. 기본 모델이 충분한 시도를 통해 정답을 찾을 수 있지만, RL로 훈련된 모델은 찾지 못하는 경우, 이는 RL이 샘플링 효율성을 향상시켰지만(정답이 더 자주 나타남) 오히려 전체적인 추론 능력을 저하시켰음을 시사합니다.

대상 사용자

  • LLM의 추론에 대한 강화학습의 영향을 연구하는 AI 연구자.
  • o1 또는 DeepSeek-R1과 같은 추론 중심 모델을 개발하는 개발자로, RLVR의 한계를 이해하고자 하는 사람.
  • 다양한 샘플링 전략에서 모델 성능을 평가하는 ML 엔지니어.

주요 특징

  • 샘플링 효율 vs. 능력: RL은 작은 k에서 샘플링 효율을 높이지만, 큰 k에서 추론 능력 경계가 약화되는 경향이 있음.
  • 기본 모델의 우수성: 시도 횟수가 증가함에 따라 기본 모델이 RL로 훈련된 모델을 따라잡고 결국 이를 능가함을 입증.
  • 알고리즘 비교: 다양한 RLVR 알고리즘이 유사한 성능을 보이며, 현재는 최적화되지 않았음.
  • vLLM 통합: seed 제어와 vLLM 내부 실행 샘플링을 통해 응답 다양성을 보장하는 구현 세부 사항 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트