LeapLabTHU/limit-of-RLVR
repo for paper https://arxiv.org/abs/2504.13837
解決的問題
本專案探討強化學習與可驗證獎勵(RLVR)是否真正提升了大語言模型(LLM)的根本推理能力,還是僅僅優化了模型存取既有知識的採樣效率。它彌補了目前對RL訓練模型是否能真正解決其基礎版本無法解決的問題,或僅是透過採樣更有效率地找到正確答案這項理解上的缺口。
作用方式
研究人員使用 pass@k 指標來評估模型。透過增加模型解決問題的嘗試次數(k),可判斷模型的「推理邊界」。若基礎模型在足夠多的嘗試後能最終找到正確答案,而RL訓練模型卻無法做到,這表示RL提升了採樣效率(使正確答案更常出現),但實際上可能降低了整體推理能力。
適用對象
- 研究強化學習對LLM推理影響的AI研究人員。
- 開發推理導向模型(如o1或DeepSeek-R1)的開發者,希望理解RLVR的限制。
- 評估不同採樣策略下模型效能的ML工程師。
主要亮點
- 採樣效率 vs. 推理能力:發現RL提升採樣效率(小k時表現更佳),但可能降低推理能力邊界(大k時表現更差)。
- 基礎模型優勢:證明隨著樣本數增加,基礎模型會持續追上並最終超越RL訓練模型。
- 算法比較:觀察到各種RLVR算法表現相似,目前遠未達最佳。
- vLLM整合:提供使用seed控制與vLLM內部採樣確保回應多樣性的實作細節。
相關
- 專案
- 專案
- 專案
- 專案
- 專案