Open-R1: DeepSeek-R1の完全なオープン再現

Hugging Faceは、DeepSeek-R1のトレーニングパイプラインとデータセットを完全に再現するイニシアティブであるOpen-R1を発表しました。このプロジェクトは、プロプライエタリーレシピに依存せずに高性能な推論モデルを構築するために必要な透明性、コード、データをオープンソースコミュニティに提供することを目的としています。

DeepSeek-R1のアーキテクチャとトレーニング

DeepSeek-R1は、671BのMixture of Experts (MoE)モデルであるDeepSeek-V3ベースに構築された推論モデルです。DeepSeek-V3は、Multi-Head Latent Attention (MLA)、Multi Token Prediction (MTP)、および広範なハードウェア最適化の使用により約550万ドルでトレーニングされたことから、コスト効率の良さで知られています。

DeepSeekは、推論能力を開発するために2つの異なるパスを利用しました:

  • DeepSeek-R1-Zero: このバージョンは、教師ありファインチューニング (SFT) を完全にスキップしました。Group Relative Policy Optimization (GRPO) を使用した強化学習 (RL) と、精度と構造に基づく報酬システムに依存し、自己検証やステップバイステップの問題解決などの推論スキルを開発しました。強力ですが、その出力はしばしば可読性に欠けていました。
  • DeepSeek-R1: R1-Zeroの可読性の問題を解決するために、このモデルは、SFTのために慎重に作成された少数の例を使用した「コールドスタート」フェーズから始まりました。その後、さらにRLと改良が行われ、人間の好みと検証可能な報酬に基づいて低品質な出力を拒否することを含みました。

Open-R1プロジェクトの目標

DeepSeekはR1のモデルウェイトをリリースしましたが、特定のデータセットとトレーニングコードは依然としてプロプライエタリです。Open-R1プロジェクトは、以下の3段階の計画でこれらのギャップを埋めることを目的としています:

  1. Distillation: DeepSeek-R1から高品質な推論データセットを蒸留して、R1-Distillモデルを複製します。
  2. Pure RL Pipeline: 数学、推論、コードのために特別に設計された新規大規模データセットをキュレートし、R1-Zeroパイプラインを複製します。
  3. Multi-stage Training: ベースモデルからSFTへ、そしてRLへと移行する完全なパイプラインを実証します。

数学とコーディングに加えて、Hugging Faceはこれらの推論手法を医学などの他の科学分野にも応用することを検討しています。

コミュニティの洞察とプロジェクトの状況

発表後、コミュニティのディスカッションでは、「オープン」モデルの性質と再現の課題に関するいくつかの重要な点が指摘されました:

  • Evaluation Metrics: コミュニティメンバーは、真の再現には元のモデルとのパフォーマンスを検証する評価数が必要であると指摘しました。プロジェクト貢献者は、ブログ投稿はプロジェクトの紹介であり、完成した再現を主張するものではないと説明しました。
  • Data Transparency: 一部のユーザーは、ウェイトのみをリリースすることは「オープンバイナリ」またはフリーウェアであり、完全なブループリントとトレーニングデータが欠けているため真のオープンソースではないと懸念を表明しました。
  • Replication Challenges: 貢献者は、元のハイパーパラメータとデータセットがない場合、プロジェクトは元のパフォーマンスレベルに到達しようと「ベストゲス推定」に依存すると強調しました。

"歴史的に、彼らは[DeepSeek]のLLMトレーニングのコードやデータセットをリリースしたことはなく、今回も違うとは期待していません。 meantime、ベストゲス推定を行い、自分たちでそこに到達できるかを見なければなりません。"

Open-R1プロジェクトはオープンで開発されており、コードはGitHubにホストされ、モデルとデータセットはHugging FaceのOpen-R1組織にアップロードされています。

Sources