Qwen2.5-Math 릴리즈 노트
Qwen은 Qwen2.5-Math의 출시를 발표했습니다. 이 시리즈는 영어와 중국어에서 고정밀 추론을 위해 설계된 특화된 수학 대형 언어 모델(LLM)들입니다. 이 시리즈는 계산 정확성을 향상하고 복잡한 알고리즘 작업을 해결하기 위해 체인 오브 사고(Chain-of-Thought, CoT)와 함께 **Tool-Integrated Reasoning (TIR)**을 도입하여, 주력 72B 모델을 선도적인 오픈소스 수학 LLM으로 자리매김합니다.
모델 라인업 및 기능
- Base Models: Qwen2.5-Math-1.5B, 7B, 및 72B.
- Instruction-Tuned Models: Qwen2.5-Math-1.5B-Instruct, 7B-Instruct, 및 72B-Instruct.
- Reward Model: Qwen2.5-Math-RM-72B, 데이터 구축 및 강화 학습에 사용됩니다.
이전 Qwen2-Math 시리즈가 영어 CoT에 초점을 맞췄던 반면, Qwen2.5-Math는 Chinese and English 모두를 지원하도록 확대하고 **Tool-Integrated Reasoning (TIR)**을 도입했습니다. TIR은 모델이 도구(예: Python 인터프리터)를 사용하여 정밀한 계산 및 기호 조작을 수행하도록 하여, 행렬 고유값이나 이차 방정식 근과 같은 복잡한 계산을 처리하는 데 있어 CoT의 고유한 한계를 해결합니다.
기술 개선 및 학습 파이프라인
Qwen2.5-Math 모델은 Qwen2-Math 기본 모델을 세 가지 주요 방법으로 업그레이드하여 개발되었습니다:
- Synthesized Data: Qwen2-Math-72B-Instruct를 사용하여 고품질 수학 사전 학습 데이터를 생성합니다.
- Expanded Corpus: 책, 웹 소스, 코드 등에서 더 많은 고품질 수학 데이터를 집계하고 특히 중국어 데이터 비중을 늘렸습니다. Qwen Math Corpus v2는 700B에서 1T 토큰 이상으로 성장했습니다.
- Parameter Initialization: 언어 이해와 코드 생성 능력을 향상시키기 위해 Qwen2.5 시리즈 기본 모델을 활용합니다.
Instruction‑tuned 모델의 경우, Qwen은 수학 전용 보상 모델(Qwen2.5-Math-RM-72B)을 활용해 Rejection Sampling을 통해 Supervised Fine‑Tuning(SFT) 데이터를 구성하고, Group Relative Policy Optimization(GRPO)을 사용해 강화 학습을 안내했습니다.
성능 벤치마크
Qwen2.5-Math는 전 모델에 비해 큰 향상을 보이며, 선도적인 폐쇄형 모델과 경쟁합니다:
일반 수학
- Flagship Performance: Qwen2.5-Math-72B-Instruct는 Qwen2-Math-72B-Instruct보다 영어에서 평균 4.4점, 중국어에서 6.1점 더 높은 성능을 보입니다.
- TIR Advantage: TIR 설정(RM@8) 하에서 72B-Instruct 모델은 MATH 벤치마크에서 92.9점을 기록했습니다.
- Efficiency: Qwen2.5-Math-7B-Instruct 모델은 이전 Qwen2-Math-Instruct 72B를 능가하여, MATH 점수 83.6(CoT) 및 85.3(TIR)을 달성했습니다.
- Small Model Capability: 1.5B-Instruct 모델은 Python 인터프리터를 사용할 때 약 80점의 MATH 점수를 얻습니다.
복잡한 대회 수학
AIME 2024 벤치마크에서 Claude 3 Opus, GPT-4 Turbo, Gemini 1.5 Pro와 같은 폐쇄형 모델이 30문제 중 1~2문제만 해결한 반면, Qwen2.5-Math-72B-Instruct는 Greedy CoT 모드에서 9문제, TIR 모드에서 12문제를 해결했습니다. 보상 모델 지원을 받는 7B-Instruct 모델은 최대 21문제를 해결했습니다.
평가 무결성 및 데이터 정제
데이터 누출을 방지하고 편향 없는 결과를 보장하기 위해 Qwen은 엄격한 데이터 정제 과정을 구현했습니다:
- 13-gram Matching: 텍스트 정규화 후 잠재적으로 오염된 학습 샘플을 제외하는 데 사용되었습니다.
- Longest Common Subsequence (LCS): 비율이 0.6을 초과하는 경우, 특히 일반적인 수학 표현에 대해 오염을 식별하는 데 사용되었습니다.
- Dataset Filtering: GSM8K, MATH, Minerva Math, Olympiad Bench, AIME 24 등 다양한 테스트 세트에 대해 샘플을 필터링했습니다.
구현 및 데모
Qwen은 모델을 체험할 수 있는 두 가지 주요 방법을 제공합니다:
- TIR Demo: Qwen-Agent에 통합되어, 사용자가 로컬에서 코드를 실행해 Tool-Integrated Reasoning을 활용할 수 있습니다.
- Multi-modal Demo: Hugging Face와 Modelscope에서 제공되며, Qwen2-VL을 OCR에, Qwen2-Math를 추론에 결합해 이미지, 텍스트 또는 수학 문제 스케치를 처리합니다.