Open-R1 更新 #1:複製 DeepSeek-R1 訓練與合成數據
Hugging Face 已啟動 Open-R1 專案,旨在複製 DeepSeek-R1 的訓練流程與合成數據生成方式。經過一週的開發,該專案已成功重現 DeepSeek 在 MATH-500 基準測試中報告的結果,並將 Grouped Relative Policy Optimization (GRPO) 整合至 TRL 函式庫中。
重現 DeepSeek-R1 的評估與性能
Hugging Face 已證實,使用 lighteval 工具可以達到 DeepSeek 在 MATH-500 基準測試上報告的評估分數。重現結果如下:
| 模型 | MATH-500 (HF lighteval) | MATH-500 (DeepSeek 報告) |
|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | 81.6 | 83.9 |
| DeepSeek-R1-Distill-Qwen-7B | 91.8 | 92.8 |
| DeepSeek-R1-Distill-Qwen-14B | 94.2 | 93.9 |
| DeepSeek-R1-Distill-Qwen-32B | 95.0 | 94.3 |
| DeepSeek-R1-Distill-Llama-8B | 85.8 | 89.1 |
| DeepSeek-R1-Distill-Llama-70B | 93.4 | 94.5 |
回應長度的挑戰
評估過程中的一個重大發現是 DeepSeek-R1 生成內容的極長度。在 OpenThoughts 資料集中,平均回應長度為 6,000 個 tokens,部分甚至超過 20,000 個 tokens。這種長度對 GRPO 訓練構成了挑戰,因為生成長文本在優化步驟期間需要大量的 GPU 記憶體來儲存 activations 與 gradients。
訓練流程與 GRPO 整合
Grouped Relative Policy Optimization (GRPO) 已整合至 TRL 0.14 版本。此實作允許使用一個或多個獎勵函數來訓練模型,並與 DeepSpeed ZeRO 1/2/3 整合,以便在多個 GPU 上進行並行擴展。為了應對線上訓練的主要瓶頸——生成速度,該流程利用 vLLM 進行快速推論。
擴展合成數據生成
為了複製用於改進較小模型的合成推理軌跡(reasoning traces),Hugging Face 開發了一套擴展推論流程,使用大型 R1 模型來生成數據。
基礎設施與吞吐量優化
使用兩個 8xH100 節點搭配 vLLM 的初步測試顯示吞吐量不理想,因為 GPU KV cache 填充過快,導致請求被搶佔(preemption)。為了修復此問題,團隊將設置擴展至 32 個 GPU(四個 8xH100 節點),提供充足的 VRAM 以處理 32 個並行請求而無需重新調度。
轉換為串流請求
為了穩定 GPU 利用率並消除批次推論中由「落後者」(stragglers)造成的延遲,團隊從批次請求轉換為串流方式。透過維持固定數量的活動任務(例如 500 個),並在其他任務完成時立即啟動新請求,他們實現了更穩定的生成率。
社群生態系統與資料集開發
自 DeepSeek-R1 發布以來,開源社群已經產出了多個旨在以較小規模重現推理能力的專案與資料集:
值得關注的社群專案
- TinyZero:展示了使用 3B 基礎模型在不到 30 美元的成本下實現推理的「頓悟時刻」(aha-moment)。
- Mini-R1:提供重現推理湧現(reasoning emergence)指南的教學。
- HKUST 研究人員:展示了 7B 數學模型中推理能力的湧現。
- Evolving LLM Lab:正在開發 R1 的多模態版本。
關鍵合成推理資料集
- OpenThoughts-114k:包含 114,000 個高品質範例,涵蓋科學、數學、程式碼與謎題。
- Bespoke-Stratos-17k:使用 DeepSeek-R1 建立推理軌跡的 Berkeley Sky-T1 流程副本。
- Dolphin-r1:結合了來自 DeepSeek-R1、Gemini Flash 與 Dolphin Chat 完成內容的 800,000 個樣本。
- Magpie-Reasoning-V2-250K:由 DeepSeek-R1-Distill-Llama-70B 生成的 250,000 個推理回應。
行業背景與市場反應
DeepSeek-R1 的發布引發了廣泛的業界反應。OpenAI CEO Sam Altman 指出發現了與 o1 使用的想法相似之處,而 Anthropic CEO Dario Amodei 則強調了出口管制的需求。此外,包括 AWS(透過 BedRock 與 SageMaker)、Dell、Together AI 與 Fireworks AI 在內的主要供應商都已將 DeepSeek-R1 整合到其平台中。
Sources
- OriginalOpen-R1: Update #1