Qwen2-Math 릴리즈 노트

Qwen은 복잡한 산술 및 수학 문제를 해결하도록 설계된 특화된 대형 언어 모델 시리즈인 Qwen2-Math를 소개했습니다. 대표 모델인 Qwen2-Math-72B-Instruct는 최첨단 성능을 보여주며, GPT-4o, Claude-3.5-Sonnet, Gemini-1.5-Pro, Llama-3.1-405B와 같은 독점 모델들을 주요 수학 벤치마크에서 능가합니다.

모델 아키텍처 및 학습

Qwen2-Math 모델은 Qwen2 기반 위에 구축되었으며, 1.5B, 7B, 72B의 세 가지 크기로 제공됩니다. 개발 과정은 두 가지 주요 단계로 구성됩니다:

기본 모델 사전학습

기본 모델은 Qwen2에서 초기화된 후 특화된 수학 전용 코퍼스에서 사전학습됩니다. 이 데이터셋에는 다음이 포함됩니다:

  • 고품질 수학 웹 텍스트 및 서적.
  • 코드 및 시험 문제.
  • Qwen2가 합성한 수학 사전학습 데이터.

인스트럭션 튜닝

인스트럭트 버전을 만들기 위해 Qwen은 Qwen2-Math-72B를 기반으로 한 수학 전용 보상 모델을 개발했습니다. 학습 파이프라인은 다음을 활용합니다:

  • Rejection Sampling: 밀집 보상 신호와 이진 정확도 신호를 결합하여 감독 미세조정(SFT) 데이터를 구성합니다.
  • Reinforcement Learning: SFT 단계 이후 그룹 상대 정책 최적화(GRPO)를 구현합니다.

성능 및 평가

Qwen2-Math는 일반 수학과 대회 수준 수학을 모두 테스트하기 위해 다양한 영어 및 중국어 벤치마크에서 평가되었습니다.

일반 수학 벤치마크

모델은 GSM8K, Math, MMLU-STEM에서 테스트되었습니다. 인스트럭트 모델의 경우, Greedy, Maj@8, RM@8(Reward Model) 설정을 사용해 성능을 측정했습니다. 결과는 RM@8이 Maj@8보다 뛰어나며, 특히 1.5B와 7B 모델에서 수학 보상 모델의 효과성을 입증합니다.

대회 수준 수학

Qwen2-Math-Instruct는 다음과 같은 매우 도전적인 데이터셋에서 테스트되었습니다:

  • English: OlympiadBench, CollegeMath, AIME 2024, 및 AMC 2023.
  • Chinese: GaoKao (2024), CN Middle School 24, 및 CMATH.

AIME 2024와 AMC 2023과 같은 복잡한 대회 평가에서 모델은 Greedy, Maj@64, RM@64, RM@256 설정 모두에서 강력한 성능을 보여주었습니다.

데이터 디컨탐

벤치마크의 무결성을 보장하기 위해 Qwen은 사전학습 및 사후학습 데이터셋 모두에 엄격한 디컨탐 방법을 적용했습니다:

  • Exact Match: 테스트 세트에서 발견된 동일한 샘플을 제거합니다.
  • 13-gram Deduplication: 가장 긴 공통 시퀀스 비율이 0.6을 초과하는 샘플을 제거합니다.
  • Targeted Filtering: GSM8K, MATH, Aqua, SAT Math, OlympiadBench, College Math, AIME24, AMC23 등을 포함한 데이터셋에서 오염된 샘플을 제거합니다.

현재 제한 사항 및 로드맵

Qwen2-Math는 현재 주로 영어를 지원합니다. 연구소는 영어와 중국어를 모두 지원하는 이중언어 모델을 출시할 계획을 발표했으며, 접근성과 기능을 더욱 확대하기 위해 다국어 모델을 개발 중입니다.

SUMMARY: Qwen은 Qwen2-Math라는 특화된 수학 LLM 시리즈(1.5B, 7B, 72B)를 출시했으며, 수학 벤치마크에서 GPT-4o를 포함한 여러 폐쇄형 모델보다 뛰어난 성능을 보입니다.

TITLE: Qwen2-Math 릴리즈 노트

Sources