Open-R1: 完全開放的 DeepSeek-R1 重現
Hugging Face 已宣布 Open-R1,這是一項旨在完全重現 DeepSeek-R1 訓練管道和數據集的倡議。此項目旨在為開源社區提供構建高性能推理模型所需的透明度、程式碼和數據,而無需依賴專有配方。
DeepSeek-R1 的架構與訓練
DeepSeek-R1 是一種建構在 DeepSeek-V3 基礎上的推理模型,DeepSeek-V3 是一個 671B 的專家混合(MoE)模型。DeepSeek-V3 因其成本效益而聞名,透過使用 Multi-Head Latent Attention (MLA)、Multi Token Prediction (MTP) 和廣泛的硬體優化,訓練成本約為 550 萬美元。
DeepSeek 利用兩條不同的路徑來發展其推理能力:
- DeepSeek-R1-Zero: 此版本完全跳過了監督微調(SFT)。它僅依賴使用 Group Relative Policy Optimization (GRPO) 的強化學習(RL),以及基於準確性和結構的獎勵系統來發展自我驗證和逐步問題解決等推理技能。雖然強大,但其輸出經常缺乏可讀性。
- DeepSeek-R1: 為了解決 R1-Zero 的可讀性問題,此模型首先以一小組精心設計的範例進行 SFT 的「冷啟動」階段。之後進行進一步的 RL 和優化,包括基於人類偏好和可驗證獎勵拒絕低品質輸出。
Open-R1 項目目標
雖然 DeepSeek 已發布 R1 的模型權重,但具體的數據集和訓練程式碼仍屬專有。Open-R1 項目透過三步計畫來填補這些空白:
- Distillation: 透過從 DeepSeek-R1 蒸餾高品質推理數據集來複製 R1-Distill 模型。
- Pure RL Pipeline: 透過策劃專門用於數學、推理和代碼的新規模大規模數據集來複製 R1-Zero 管道。
- Multi-stage Training: 展示從基礎模型到 SFT 再到 RL 的完整管道過渡。
除了數學和編程,Hugging Face 打算探索這些推理技術在其他科學領域的應用,例如醫學。
社區見解與項目狀態
在宣布之後,社區討論凸顯了關於「開放」模型性質以及重現挑戰的幾個關鍵點:
- Evaluation Metrics: 社區成員指出,真正的重現需要評估數據來驗證與原始模型的性能。項目貢獻者澄清,這篇博客文章僅是項目的介紹,並不聲稱已完成重現。
- Data Transparency: 一些用戶擔心僅發布權重屬於「open-binary」或免費軟體,而非真正的開源,因為完整的藍圖和訓練數據缺失。
- Replication Challenges: 貢獻者強調,在缺少原始超參數和數據集的情況下,項目依賴「最佳猜測估計」來嘗試達到原始性能水平。
"Historically, they [DeepSeek] have never released code or datasets of their LLM training, so I wouldn't expect this time to be different. In the meantime we have to make best guess estimates and see if we can get there ourselves."\n Open-R1 項目正在公開開發中,程式碼託管在 GitHub 上,模型和數據集正被上傳到 Hugging Face 上的 Open-R1 組織。