Open-R1: 重現 DeepSeek-R1 推理流水線

Hugging Face 推出了 Open-R1,這是一個致力於完全開放重現 DeepSeek-R1 推理流水線的專案。透過提供必要的腳本、配方和精選數據集,Open-R1 使社群能夠複製 DeepSeek-R1 的推理能力,特別專注於從基礎模型到經 RL 微調的推理模型的轉變。

專案路線圖與目前進度

Open-R1 專案遵循基於 DeepSeek-R1 技術報告的三步「攻擊計畫」,以實現推理模型創建的民主化:

  1. 複製 R1-Distill 模型: 從 DeepSeek-R1 蒸餾出高品質語料庫,以創建更小且功能強大的推理模型。
  2. 複製純 RL 流水線: 使用數學、推理和代碼的大規模數據集來重現 R1-Zero 流水線。
  3. 多階段訓練: 展示從基礎模型到經 RL 微調模型的路徑,透過多階段訓練。

截至 2025 年 5 月 26 日,步驟 1 已完成。Hugging Face 發布了 Mixture-of-Thoughts 數據集,其中包含從 R1 蒸餾出的 35 萬條經過驗證的推理軌跡,涵蓋數學、編碼和科學領域。此數據集被用於訓練 OpenR1-Distill-7B,它複製了 deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 的性能。

訓練方法論:SFT 與 GRPO

Open-R1 支持兩種主要的訓練範式來實現推理能力:

Supervised Fine-Tuning (SFT)

SFT 用於蒸餾。透過在 Mixture-of-Thoughts 等數據集上進行訓練,開發者可以快速將推理軌跡注入基礎模型中。例如,OpenR1-Distill-7B 模型在 AIME 2024 上獲得了 52.7 分,在 MATH-500 上獲得了 89.0 分,非常接近或超過了原始的 DeepSeek-R1-Distill-Qwen-7B。

Group Relative Policy Optimization (GRPO)

為了擴展訓練並向 R1-Zero 方法邁進,Open-R1 實現了 GRPO。該專案利用 vLLM backend 透過 TRL 在多個節點上擴展訓練。

GRPO 實現的一個關鍵功能是 code reward function,它允許模型根據生成的代碼實際執行結果來獲得獎勵。這透過沙盒環境支持:

  • E2B: 針對 Python 優化的雲端沙盒。
  • Morph: 支持 Python, JS, C++, 和 Rust 的雲端沙盒。
  • Piston: 用於 IOI 和 CodeForces 問題的替代執行提供者。

評估與基準測試

Open-R1 使用 lighteval 來重現 DeepSeek 的報告結果。為了確保準確性,該專案強調了對每個查詢進行多次採樣以估算 pass@1 準確度的重要性,特別是對於高變異性的基準測試,如 AIME 2024(其中每個查詢使用 64 條回應)。

重現結果

Open-R1 成功在幾個關鍵基準測試中,於 1-3 個標準差範圍內重現了 DeepSeek 的結果:

Benchmark DeepSeek-R1-Distill-Qwen-32B (Open-R1 Eval) DeepSeek-R1-Distill-Qwen-32B (DeepSeek Reported)
AIME 2024 69.7 72.6
MATH-500 95.6 94.3
GPQA Diamond 63.1 62.1
LiveCodeBench 56.0 57.2

數據生成與去污染

該專案提供了一個完整的流水線,使用 Distilabel 生成合成推理數據。用戶可以從小型蒸餾 R1 模型(在單個 H100 上)或完整的 DeepSeek-R1 模型(需要多個節點和 vLLM dev wheels 以修復 CUDA graph capture 問題)生成數據。

為了保持基準測試的完整性,Open-R1 包含一個去污染腳本 (scripts/decontaminate.py),該腳本使用 8-grams 來識別並從訓練數據集中移除受污染的樣本。

社群洞察與反對觀點

雖然該專案提供了一個重要的技術框架,但 Hacker News 上的社群討論突顯了對該重現過程「完全開放」性質的一些懷疑:

"Doesn't look like they managed to actually reproduce R1, and only stopped on Step 1 out of their 3-step plan."

其他貢獻者建議查看像 OLMoNemotron 這樣的專案,以獲取更全面的開放訓練流水線,或者查看 OpenThoughts 以獲取更先進的數據策劃方法論和性能優於 DeepSeek 小型推理變體的模型。

Sources