Open-R1 업데이트 #1: DeepSeek-R1 훈련 및 합성 데이터 복제

Hugging Face는 DeepSeek-R1의 훈련 파이프라인 및 합성 데이터 생성을 복제하기 위해 Open-R1 프로젝트를 출시했습니다. 일주일간의 개발 후, 프로젝트는 MATH-500 벤치마크에서 DeepSeek의 보고된 결과를 성공적으로 재현하고 TRL 라이브러리에 Grouped Relative Policy Optimization (GRPO)를 통합했습니다.

DeepSeek-R1 평가 및 성능 재현

Hugging Face는 lighteval 도구를 사용하여 MATH-500 벤치마크에서 DeepSeek이 보고한 평가 점수와 일치할 수 있음을 확인했습니다. 재현된 결과는 다음과 같습니다:

Model MATH-500 (HF lighteval) MATH-500 (DeepSeek 보고된)
DeepSeek-R1-Distill-Qwen-1.5B 81.6 83.9
DeepSeek-R1-Distill-Qwen-7B 91.8 92.8
DeepSeek-R1-Distill-Qwen-14B 94.2 93.9
DeepSeek-R1-Distill-Qwen-32B 95.0 94.3
DeepSeek-R1-Distill-Llama-8B 85.8 89.1
DeepSeek-R1-Distill-Llama-70B 93.4 94.5

응답 길이의 도전 과제

평가 중에 중요한 발견은 DeepSeek-R1 생성물의 극단적인 길이입니다. OpenThoughts 데이터셋에서 평균 응답 길이는 6,000 토큰이며, 일부는 20,000 토큰을 초과합니다. 이 길이는 긴 완성을 생성하는 데 상당한 GPU 메모리가 필요하여 활성화와 그래디언트를 최적화 단계 동안 저장해야 하기 때문에 GRPO 훈련에 도전이 됩니다.

훈련 파이프라인 및 GRPO 통합

Grouped Relative Policy Optimization (GRPO)가 TRL 버전 0.14에 통합되었습니다. 이 구현은 하나 또는 여러 보상 함수를 사용하여 모델 훈련을 허용하며, 여러 GPU에 걸쳐 병렬 확장을 위해 DeepSpeed ZeRO 1/2/3와 통합됩니다. 온라인 훈련의 주요 병목점인 생성 속도를 해결하기 위해 파이프라인은 빠른 추론을 위해 vLLM을 활용합니다.

합성 데이터 생성 확장

더 작은 모델을 개선하는 데 사용된 합성 추론 흔적을 복제하기 위해, Hugging Face는 큰 R1 모델을 사용하여 데이터를 생성하는 확장된 추론 파이프라인을 개발했습니다.

인프라 및 처리량 최적화

두 개의 8xH100 노드에서 vLLM을 사용한 초기 테스트는 GPU KV 캐시가 너무 빨리 채워져 요청 선점이 발생함으로써 처리량이 최적적이지 않았습니다. 이를 해결하기 위해 팀은 32개의 GPU (네 개의 8xH100 노드)로 설정을 확장하여, 재스케줄링 없이 32개의 병렬 요청을 처리할 수 있는 충분한 VRAM을 제공했습니다.

스트리밍 요청으로의 전환

배치 추론에서 'stragglers'로 인한 지연을 안정화하고 GPU 활용도를 제거하기 위해, 팀은 배치 요청에서 스트리밍 방식으로 전환했습니다. 활성 작업 수를 일정하게 유지 (예: 500) 하고 다른 작업이 완료되는 즉시 새로운 요청을 시작함으로써, 그들은 더 일관된 생성률을 달성했습니다.

커뮤니티 생태계 및 데이터셋 개발

DeepSeek-R1 출시 이후, 오픈소스 커뮤니티는 더 작은 규모에서 추론 능력을 재현하는 것을 목표로 하는 여러 프로젝트와 데이터셋을 제작했습니다:

주목할 만한 커뮤니티 프로젝트

  • TinyZero: 3B 기본 모델을 사용하여 $30 미만으로 reasoning의 "aha-moment"를 보여줍니다.
  • Mini-R1: reasoning의 출현을 재현하는 가이드를 제공하는 튜토리얼입니다.
  • HKUST Researchers: 7B 수학 모델에서 reasoning의 출현을 보여주었습니다.
  • Evolving LLM Lab: R1의 멀티모달 버전을 개발 중입니다.

주요 합성 추론 데이터셋

  • OpenThoughts-114k: 과학, 수학, 코드, 퍼즐을 다루는 114,000개의 고품질 예시.
  • Bespoke-Stratos-17k: DeepSeek-R1을 사용하여 추론 흔적을 만드는 Berkeley Sky-T1 파이프라인의 복제.
  • Dolphin-r1: DeepSeek-R1, Gemini Flash, Dolphin Chat의 완성을 결합한 800,000개의 샘플.
  • Magpie-Reasoning-V2-250K: DeepSeek-R1-Distill-Llama-70B가 생성한 250,000개의 추론 응답.

산업 맥락 및 시장 반응

DeepSeek-R1의 출시로 광범위한 산업 반응이 촉발되었습니다. OpenAI CEO Sam Altman은 o1에서 사용된 아이디어와 유사한 아이디어의 발견을 언급했으며, Anthropic CEO Dario Amodei는 수출 통제의 필요성을 강조했습니다. 또한 AWS (BedRock 및 SageMaker를 통해), Dell, Together AI, 그리고 Fireworks AI와 같은 주요 제공업체가 DeepSeek-R1을 그들의 플랫폼에 통합했습니다.

Sources