Cosmopedia: LLM 사전 학습을 위한 대규모 합성 데이터

Hugging Face는 Microsoft의 Phi 모델 학습 방식을 재현하도록 설계된 대규모 합성 데이터셋인 Cosmopedia를 공개했습니다. 이 데이터셋은 3천만 개 이상의 파일과 250억 토큰을 포함하고 있어, 처음부터 Large Language Model(LLM)을 사전 학습하기 위한 가장 큰 공개 합성 데이터셋입니다.

사전 학습을 위한 합성 데이터 규모 확장

합성 데이터는 일반적으로 instruction‑tuning에 사용되지만, Cosmopedia는 몇 천 개의 샘플에서 수백만 개의 고품질 샘플로 확장하는 과제에 초점을 맞추었습니다. 이 노력은 Phi 시리즈의 성능에서 영감을 받았으며, 주로 합성 "교과서 스타일" 데이터로 학습된 모델이 일반 웹 데이터로 학습된 더 큰 모델을 능가할 수 있음을 보여주었습니다.

데이터셋 생성 방법론

Cosmopedia는 Mixtral-8x7B-Instruct-v0.1을 사용해 생성되었습니다. 핵심 과제는 3천만 개의 프롬프트 전반에 걸쳐 다양성을 유지하고 중복 콘텐츠를 최소화하는 것이었습니다. Hugging Face는 프롬프트 선별을 위해 세 가지 주요 전략을 적용했습니다:

1. 선별된 출처

Stanford 강의, Khan Academy, OpenStax, WikiHow와 같은 교육 자료를 활용해 개요와 주제를 추출했습니다. 제한된 출처의 활용도를 극대화하기 위해 청중과 스타일의 다양성을 활용했습니다. 하나의 주제를 다양한 대상(어린이, 고등학생, 대학생, 연구자)과 다양한 형식(교과서, 블로그 포스트, wikiHow 기사)으로 재구성했습니다.

2. 웹 데이터

웹 데이터는 프롬프트의 80% 이상을 차지했습니다. 팀은 RefinedWeb 등 데이터셋에서 수백만 개의 웹 샘플을 145개의 클러스터로 군집화했습니다. 이후 Mixtral을 사용해 각 클러스터의 공통 주제를 식별했습니다. 연예 가십이나 성인 콘텐츠와 같이 교육적 가치가 낮은 내용은 필터링하여 112개의 주제를 남겼습니다. 그런 다음 모델에 해당 주제 내 웹 샘플을 기반으로 교과서를 생성하도록 지시해 프롬프트를 만들었습니다.

3. Instruction 데이터셋 및 스토리

초기 모델이 상식과 기본 초등 교육 지식이 부족한 문제를 해결하기 위해 UltraChat과 OpenHermes2.5를 시드 데이터로 활용해 일상적인 지식을 포함한 스토리를 생성했습니다.

기술 스택 및 구현

250억 토큰을 생성하려면 H100 GPU에서 10,000시간 이상의 GPU 시간이 필요했습니다. 구현에 사용된 주요 기술은 다음과 같습니다:

  • Text Clustering: text-clustering 저장소를 사용해 웹 데이터를 조직했습니다.
  • Generation at Scale: llm-swarm 라이브러리를 활용해 Mixtral-8x7B를 로컬에서 TGI(Text Generation Inference)와 vLLM으로 배포했습니다.
  • Decontamination: 벤치마크 누수를 방지하기 위해 10‑gram 겹침과 difflib.SequenceMatcher를 이용한 파이프라인을 구현했습니다. 벤치마크 샘플과의 매치 비율이 0.5를 초과하면 해당 샘플을 폐기했습니다.
  • Training and Evaluation: nanotron 라이브러리를 통해 Llama2 아키텍처 기반 1B 파라미터 모델(cosmo-1b)을 학습하고, lighteval로 평가했습니다.

Cosmo-1B 성능

cosmo-1b 모델을 평가한 결과, ARC‑easy, ARC‑challenge, OpenBookQA, MMLU에서 TinyLlama 1.1B보다 우수한 성능을 보였습니다. ARC‑challenge와 OpenBookQA에서는 Qwen‑1.5‑1B와 비슷한 수준이지만, Phi‑1.5에 비해 여전히 성능 격차가 존재합니다.

향후 방향

Hugging Face는 역사적 사실과 수학적 추론에서 발생하는 환각(hallucination)을 주요 개선 영역으로 꼽았습니다. 제안된 해결책으로는 생성 과정에서 Wikipedia와 같은 외부 정보를 활용하는 Retrieval Augmented Generation(RAG) 적용과, 문제 영역을 식별하기 위한 환각 측정 방법 구현이 있습니다.

Sources