LeapLabTHU/limit-of-RLVR

repo for paper https://arxiv.org/abs/2504.13837

解决的问题

本项目研究强化学习与可验证奖励(RLVR)是否真正提升了大语言模型(LLM)的根本推理能力,还是仅仅优化了模型获取现有知识的采样效率。它填补了当前对RL训练模型能否真正解决其基础版本无法解决的问题,还是仅通过采样更高效地找到正确答案这一理解上的空白。

工作原理

研究人员使用 pass@k 指标来评估模型。通过增加模型解决一个问题的尝试次数(k),可以确定模型的「推理边界」。如果基础模型在足够多的尝试后能最终找到正确答案,而RL训练模型却无法做到,这表明RL提升了采样效率(使正确答案更频繁出现),但实际可能降低了整体推理能力。

适用对象

  • 研究强化学习对LLM推理影响的AI研究人员。
  • 开发推理导向模型(如o1或DeepSeek-R1)的开发者,希望理解RLVR的局限性。
  • 评估不同采样策略下模型性能的ML工程师。

主要亮点

  • 采样效率 vs. 推理能力:发现RL提升了采样效率(小k时表现更好),但可能降低了推理能力边界(大k时表现更差)。
  • 基础模型优势:证明随着样本数量增加,基础模型会持续追上并最终超越RL训练模型。
  • 算法对比:观察到各种RLVR算法表现相似,目前远未达到最优。
  • vLLM集成:提供使用seed控制和vLLM内部采样确保响应多样性的实现细节。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目