Open R1 更新 #2:OpenR1-Math-220k 數據集與推理見解
Hugging Face 已發布 OpenR1-Math-220k,這是一個大規模的數學推理數據集,旨在複製 DeepSeek R1 的蒸餾能力。此發布是更廣泛的 Open R1 計畫的一部分,該計畫旨在開源用於創建高性能推理模型的訓練管道和合成數據生成方法。
OpenR1-Math-220k 數據集
OpenR1-Math-220k 數據集提供了一個基礎,通過蒸餾將先進的推理能力轉移到較小的模型,彌補了原始 DeepSeek R1 蒸餾中使用的非公開推理痕跡留下的空白。
數據生成管道
Hugging Face 使用 512 個 H100 GPU 在本地生成了該數據集,利用 vLLM 和 SGLang 產生推理痕跡。轉向 SGLang 帶來了近 2 倍的加速,使每個 H100 每小時的吞吐量從 15 增加到 25 個解決方案,從而使每日能生成 180k 個痕跡。
生成過程的關鍵技術規格包括:
- 來源材料:基於 NuminaMath 1.5,這是 NuminaMath-CoT 的改進版本。
- 規模:為 400k 個問題生成了 800k 條 R1 推理痕跡(每個問題兩到四個解決方案)。
- 提示:DeepSeek R1 被提示「逐步推理,並將最終答案放在 \boxed{} 內」。
- Token 限制:每次生成設置了 16k 個 token 的上限,因為分析顯示 25% 的問題需要超過 8k 個 token。
自動過濾與品質控制
為確保高品質的推理痕跡,Hugging Face 採用了混合驗證系統:
- 規則驗證:使用 Math Verify,團隊提取最終答案並與真實數據進行比較。55% 的問題至少有一個正確答案。
- LLM 基礎評估:對於真實答案格式錯誤或為空的情況,Llama-3.3-70B-Instruct 擔任裁判,判斷模型的解答是否與參考答案等價,從而恢復了 28,000 之前被拒絕的問題。
最終數據集包含 220k 個帶有驗證推理痕跡的問題。它提供兩個分割:default 分割(94k 問題)和 extended 分割(131k 問題)。default 分割在經過 Supervised Fine-Tuning (SFT) 後表現最佳。
性能基準
在將 Qwen2.5-Math-Instruct 在 default 分割上進行 3 個 epoch 的微調(學習率 5e-5,RoPE 頻率提升至 300k 以適應 32k 上下文長度),得到的 OpenR1-Qwen-7B 模型在與 DeepSeek-Distill-Qwen-7B 的競爭中表現出色:
| Model | MATH-500 | AIME24 | AIME25 |
|---|---|---|---|
| DeepSeek-Distill-Qwen-7B | 91.6 | 43.3 | 40 |
| OpenR1-Qwen-7B | 90.6 | 36.7 | 40 |
| OpenThinker-7B | 89.6 | 30.0 | 33.3 |
Math-Verify 改進
Hugging Face 更新了 Math-Verify (v0.5.2),以更穩健地處理複雜的數學表達式。主要改進包括:
- 增強對純文本答案和答案列表的解析。
- 支持在單個 LaTeX 環境內的多個框選答案。
- 引入有序元組,以根據黃金答案區分集合和元組。
- 支持關係表達式(例如,$1 < x < 2$)和區間(例如,$(1,2)$)。
社區對推理與 GRPO 的見解
近期社區發展凸顯了在開放模型中 eliciting 推理能力的方式正在發生轉變。
GRPO 與基礎模型能力
- 基礎模型推理:在 Qwen2.5-0.5B 基礎模型上進行的 GRPO 實驗顯示,相較於 Instruct 版本在 GSM8k 上提升了 10 分。一些研究人員認為,DeepSeek-R1 中描述的「啊哈」時刻可能是基礎模型固有能力的症狀,而非僅僅是 RL 過程的結果。
- 效率:Unsloth 已優化 GRPO,使多達 15B 參數的模型僅需 15GB VRAM 即可進行訓練。
- 不可驗證領域:GRPO 已成功應用於詩歌,展示了其在傳統可驗證任務(如數學和程式碼)之外的實用性。
數據效率與潛在空間推理
- 小規模高品質數據:對於如 s1K(1,000 個樣本)和 LIMO(817 個樣本)等數據集的研究顯示,如果模型具備足夠的預訓練知識,極少量高品質且結構良好的範例即可解鎖先進的推理能力。
- 潛在空間推理:最近的一篇論文提出,透過使用遞迴語言模型在潛在空間中隱式進行推理,可以擴展測試時間計算量,這比生成大量自然語言的「思考」token 更具計算效率。
鏈式思考(CoT)長度控制
- 預算強制:此技術透過附加「等待」或結束思考的 token 來延伸或截斷推理,允許在測試時間進行縮放,其中增加的思考時間與更高的準確度相關聯。
- 餘弦獎勵:一種新穎的獎勵函數,用於激勵正確答案時較短的 CoT 和錯誤答案時較長的 CoT,以穩定 RL 訓練並防止獎勵黑客行為(模型透過重複增加 CoT 長度以獲取獎勵)。
Sources
- OriginalOpen R1: Update #2