Open-R1: 重現 DeepSeek-R1 推理流水線
Hugging Face 推出了 Open-R1,這是一個致力於完全開放重現 DeepSeek-R1 推理流水線的專案。透過提供必要的腳本、配方和精選數據集,Open-R1 使社群能夠複製 DeepSeek-R1 的推理能力,特別專注於從基礎模型到經 RL 微調的推理模型的轉變。
專案路線圖與目前進度
Open-R1 專案遵循基於 DeepSeek-R1 技術報告的三步「攻擊計畫」,以實現推理模型創建的民主化:
- 複製 R1-Distill 模型: 從 DeepSeek-R1 蒸餾出高品質語料庫,以創建更小且功能強大的推理模型。
- 複製純 RL 流水線: 使用數學、推理和代碼的大規模數據集來重現 R1-Zero 流水線。
- 多階段訓練: 展示從基礎模型到經 RL 微調模型的路徑,透過多階段訓練。
截至 2025 年 5 月 26 日,步驟 1 已完成。Hugging Face 發布了 Mixture-of-Thoughts 數據集,其中包含從 R1 蒸餾出的 35 萬條經過驗證的推理軌跡,涵蓋數學、編碼和科學領域。此數據集被用於訓練 OpenR1-Distill-7B,它複製了 deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 的性能。
訓練方法論:SFT 與 GRPO
Open-R1 支持兩種主要的訓練範式來實現推理能力:
Supervised Fine-Tuning (SFT)
SFT 用於蒸餾。透過在 Mixture-of-Thoughts 等數據集上進行訓練,開發者可以快速將推理軌跡注入基礎模型中。例如,OpenR1-Distill-7B 模型在 AIME 2024 上獲得了 52.7 分,在 MATH-500 上獲得了 89.0 分,非常接近或超過了原始的 DeepSeek-R1-Distill-Qwen-7B。
Group Relative Policy Optimization (GRPO)
為了擴展訓練並向 R1-Zero 方法邁進,Open-R1 實現了 GRPO。該專案利用 vLLM backend 透過 TRL 在多個節點上擴展訓練。
GRPO 實現的一個關鍵功能是 code reward function,它允許模型根據生成的代碼實際執行結果來獲得獎勵。這透過沙盒環境支持:
- E2B: 針對 Python 優化的雲端沙盒。
- Morph: 支持 Python, JS, C++, 和 Rust 的雲端沙盒。
- Piston: 用於 IOI 和 CodeForces 問題的替代執行提供者。
評估與基準測試
Open-R1 使用 lighteval 來重現 DeepSeek 的報告結果。為了確保準確性,該專案強調了對每個查詢進行多次採樣以估算 pass@1 準確度的重要性,特別是對於高變異性的基準測試,如 AIME 2024(其中每個查詢使用 64 條回應)。
重現結果
Open-R1 成功在幾個關鍵基準測試中,於 1-3 個標準差範圍內重現了 DeepSeek 的結果:
| Benchmark | DeepSeek-R1-Distill-Qwen-32B (Open-R1 Eval) | DeepSeek-R1-Distill-Qwen-32B (DeepSeek Reported) |
|---|---|---|
| AIME 2024 | 69.7 | 72.6 |
| MATH-500 | 95.6 | 94.3 |
| GPQA Diamond | 63.1 | 62.1 |
| LiveCodeBench | 56.0 | 57.2 |
數據生成與去污染
該專案提供了一個完整的流水線,使用 Distilabel 生成合成推理數據。用戶可以從小型蒸餾 R1 模型(在單個 H100 上)或完整的 DeepSeek-R1 模型(需要多個節點和 vLLM dev wheels 以修復 CUDA graph capture 問題)生成數據。
為了保持基準測試的完整性,Open-R1 包含一個去污染腳本 (scripts/decontaminate.py),該腳本使用 8-grams 來識別並從訓練數據集中移除受污染的樣本。
社群洞察與反對觀點
雖然該專案提供了一個重要的技術框架,但 Hacker News 上的社群討論突顯了對該重現過程「完全開放」性質的一些懷疑:
"Doesn't look like they managed to actually reproduce R1, and only stopped on Step 1 out of their 3-step plan."
其他貢獻者建議查看像 OLMo 或 Nemotron 這樣的專案,以獲取更全面的開放訓練流水線,或者查看 OpenThoughts 以獲取更先進的數據策劃方法論和性能優於 DeepSeek 小型推理變體的模型。