Open-R1:对 DeepSeek-R1 的完全开源复现

Hugging Face 宣布启动 Open-R1 项目,这是一项旨在完全复现 DeepSeek-R1 训练流水线和数据集的倡议。该项目旨在为开源社区提供构建高性能推理模型所需的透明度、代码和数据,而无需依赖专有方案。

DeepSeek-R1 的架构与训练

DeepSeek-R1 是一个基于 DeepSeek-V3 基座构建的推理模型,后者是一个拥有 671B 参数的混合专家模型 (MoE)。DeepSeek-V3 以其成本效益著称,通过使用 Multi-Head Latent Attention (MLA)、Multi Token Prediction (MTP) 以及广泛的硬件优化,其训练成本约为 550 万美元。

DeepSeek 利用两条不同的路径来开发其推理能力:

  • DeepSeek-R1-Zero:该版本完全跳过了监督微调 (SFT)。它仅依靠使用 Group Relative Policy Optimization (GRPO) 的强化学习 (RL) 以及基于准确性和结构的奖励系统,来开发诸如自我验证和逐步解决问题等推理技能。虽然功能强大,但其输出往往缺乏可读性。
  • DeepSeek-R1:为了解决 R1-Zero 的可读性问题,该模型从一个“冷启动”阶段开始,使用一小组精心设计的示例进行 SFT。随后是进一步的 RL 和优化,包括根据人类偏好和可验证奖励来拒绝低质量输出。

Open-R1 项目目标

虽然 DeepSeek 发布了 R1 的模型权重,但具体的训练数据集和训练代码仍是专有的。Open-R1 项目旨在通过以下三个步骤的计划来填补这些空白:

  1. 蒸馏 (Distillation):通过从 DeepSeek-R1 中蒸馏高质量的推理数据集,来复现 R1-Distill 模型。
  2. 纯 RL 流水线 (Pure RL Pipeline):通过专门为数学、推理和代码策划新的大规模数据集,来复现 R1-Zero 流水线。
  3. 多阶段训练 (Multi-stage Training):展示从基座模型到 SFT 再到 RL 的完整流水线。

除了数学和编程,Hugging Face 还打算探索这些推理技术在医学等其他科学领域的应用。

社区见解与项目状态

公告发布后,社区讨论强调了关于“开源”模型本质和复现挑战的几个关键点:

  • 评估指标:社区成员指出,真正的复现需要评估数据来验证其相对于原始模型的性能。项目贡献者澄清,该博客文章是对项目的介绍,而非声称已完成复现。
  • 数据透明度:一些用户表示,仅发布权重属于“开源二进制”或免费软件,而不是真正的开源,因为完整的蓝图和训练数据仍然缺失。
  • 复现挑战:贡献者强调,如果没有原始的超参数和数据集,该项目将依靠“最佳猜测估计”来尝试达到原始性能水平。

“从历史上看,他们 [DeepSeek] 从未发布过其 LLM 训练的代码或数据集,所以我并不认为这次会有所不同。与此同时,我们必须做出最佳猜测估计,看看我们能否自己达到那个水平。”

Open-R1 项目正在公开进行中,代码托管在 GitHub 上,模型和数据集则上传至 Hugging Face 上的 Open-R1 组织。

Sources