Qwen2-Math 릴리즈 노트
Qwen은 복잡한 산술 및 수학 문제를 해결하도록 설계된 특화된 대형 언어 모델 시리즈인 Qwen2-Math를 소개했습니다. 대표 모델인 Qwen2-Math-72B-Instruct는 최첨단 성능을 보여주며, GPT-4o, Claude-3.5-Sonnet, Gemini-1.5-Pro, Llama-3.1-405B와 같은 독점 모델들을 주요 수학 벤치마크에서 능가합니다.
모델 아키텍처 및 학습
Qwen2-Math 모델은 Qwen2 기반 위에 구축되었으며, 1.5B, 7B, 72B의 세 가지 크기로 제공됩니다. 개발 과정은 두 가지 주요 단계로 구성됩니다:
기본 모델 사전학습
기본 모델은 Qwen2에서 초기화된 후 특화된 수학 전용 코퍼스에서 사전학습됩니다. 이 데이터셋에는 다음이 포함됩니다:
- 고품질 수학 웹 텍스트 및 서적.
- 코드 및 시험 문제.
- Qwen2가 합성한 수학 사전학습 데이터.
인스트럭션 튜닝
인스트럭트 버전을 만들기 위해 Qwen은 Qwen2-Math-72B를 기반으로 한 수학 전용 보상 모델을 개발했습니다. 학습 파이프라인은 다음을 활용합니다:
- Rejection Sampling: 밀집 보상 신호와 이진 정확도 신호를 결합하여 감독 미세조정(SFT) 데이터를 구성합니다.
- Reinforcement Learning: SFT 단계 이후 그룹 상대 정책 최적화(GRPO)를 구현합니다.
성능 및 평가
Qwen2-Math는 일반 수학과 대회 수준 수학을 모두 테스트하기 위해 다양한 영어 및 중국어 벤치마크에서 평가되었습니다.
일반 수학 벤치마크
모델은 GSM8K, Math, MMLU-STEM에서 테스트되었습니다. 인스트럭트 모델의 경우, Greedy, Maj@8, RM@8(Reward Model) 설정을 사용해 성능을 측정했습니다. 결과는 RM@8이 Maj@8보다 뛰어나며, 특히 1.5B와 7B 모델에서 수학 보상 모델의 효과성을 입증합니다.
대회 수준 수학
Qwen2-Math-Instruct는 다음과 같은 매우 도전적인 데이터셋에서 테스트되었습니다:
- English: OlympiadBench, CollegeMath, AIME 2024, 및 AMC 2023.
- Chinese: GaoKao (2024), CN Middle School 24, 및 CMATH.
AIME 2024와 AMC 2023과 같은 복잡한 대회 평가에서 모델은 Greedy, Maj@64, RM@64, RM@256 설정 모두에서 강력한 성능을 보여주었습니다.
데이터 디컨탐
벤치마크의 무결성을 보장하기 위해 Qwen은 사전학습 및 사후학습 데이터셋 모두에 엄격한 디컨탐 방법을 적용했습니다:
- Exact Match: 테스트 세트에서 발견된 동일한 샘플을 제거합니다.
- 13-gram Deduplication: 가장 긴 공통 시퀀스 비율이 0.6을 초과하는 샘플을 제거합니다.
- Targeted Filtering: GSM8K, MATH, Aqua, SAT Math, OlympiadBench, College Math, AIME24, AMC23 등을 포함한 데이터셋에서 오염된 샘플을 제거합니다.
현재 제한 사항 및 로드맵
Qwen2-Math는 현재 주로 영어를 지원합니다. 연구소는 영어와 중국어를 모두 지원하는 이중언어 모델을 출시할 계획을 발표했으며, 접근성과 기능을 더욱 확대하기 위해 다국어 모델을 개발 중입니다.
SUMMARY: Qwen은 Qwen2-Math라는 특화된 수학 LLM 시리즈(1.5B, 7B, 72B)를 출시했으며, 수학 벤치마크에서 GPT-4o를 포함한 여러 폐쇄형 모델보다 뛰어난 성능을 보입니다.
TITLE: Qwen2-Math 릴리즈 노트
Sources
- OriginalIntroducing Qwen2-Math