Qwen2.5 LLM 시리즈 출시
TL;DR
Qwen은 Qwen2.5 시리즈를 발표했습니다 – 0.5B에서 72B 파라미터까지의 디코더‑전용 LLM 패밀리로, 이전 Qwen2 모델보다 최대 두 배의 성능을 제공하면서 3B, 14B, 32B 크기는 완전 오픈‑소스입니다. 업그레이드에는 18조 토큰 규모의 대규모 사전학습 코퍼스, 지식·코딩·수학·정렬에서의 큰 향상, 그리고 최대 128K 토큰의 컨텍스트 윈도우가 포함됩니다.
Qwen2.5 릴리스 개요
- Model lineup – 7개의 오픈‑소스 모델 (0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B). 3B, 14B, 32B 체크포인트는 프로덕션‑그레이드(10‑30B)와 모바일‑사이드(≈3B) 워크로드 수요를 충족하기 위해 새롭게 추가되었습니다.
- Licensing – 모든 모델은 Apache‑2.0 라이선스를 사용하지만 Qwen2.5‑3B는 Qwen Research License, Qwen2.5‑72B는 Qwen License를 적용합니다.
- Context & generation – 컨텍스트 길이는 최대 128 K 토큰, 생성 길이는 최대 8 K 토큰으로, 장문 출력이 가능합니다.
- Access – 오픈‑소스 체크포인트 외에도 Qwen‑Plus와 Qwen‑Turbo가 Alibaba Cloud Model Studio API를 통해 제공됩니다.
Qwen2 대비 기술적 개선 사항
| 업그레이드 | 상세 |
|---|---|
| Dataset size | 사전학습 데이터가 7 T 토큰에서 최대 18 T 토큰으로 증가했습니다. |
| Knowledge | MMLU 점수가 70.3 → 74.2 (7B) 및 84.2 → 86.1 (72B) 로 상승했습니다. GPQA, MMLU‑Pro, MMLU‑Redux, ARC‑C에서도 개선이 관찰되었습니다. |
| Coding | Qwen2.5‑Coder가 도입되었습니다. Qwen2.5‑72B‑Instruct는 LiveCodeBench 55.5, MultiPL‑E 75.1, MBPP 88.2 점수를 기록하며 Qwen2‑72B‑Instruct(32.2, 69.2, 80.2)를 능가합니다. |
| Mathematics | Qwen2‑math 기술이 통합되었습니다. MATH 벤치마크 점수가 75.5 (7B) 및 83.1 (72B) 로 52.9 / 69.0에서 크게 상승했습니다. |
| Alignment | Arena‑Hard 점수가 48.1 → 81.2, MT‑Bench가 9.12 → 9.35 로 72B 인스트럭션 모델에서 크게 향상되었습니다. |
| Other capabilities | 명령 수행, 장문 생성 (1 K → 8 K 토큰), 표 이해, JSON 생성, 다양한 시스템 프롬프트에 대한 견고성 등이 모두 현저히 개선되었습니다. |
모델 카드 하이라이트
| Model | Params | Layers | Heads (KV) | Context | Generation | License |
|---|---|---|---|---|---|---|
| Qwen2.5‑0.5B | 0.49 B | 24 | 14/2 | 32 K | 8 K | Apache 2.0 |
| Qwen2.5‑1.5B | 1.54 B | 28 | 12/2 | 32 K | 8 K | Apache 2.0 |
| Qwen2.5‑3B | 3.09 B | 36 | 16/2 | 32 K | 8 K | Qwen Research |
| Qwen2.5‑7B | 7.61 B | 28 | 28/4 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑14B | 14.7 B | 48 | 40/8 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑32B | 32.5 B | 64 | 40/8 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑72B | 72.7 B | 80 | 64/8 | 128 K | 8 K | Qwen |
벤치마크 성능 – 기본 모델
72B 모델
Qwen2.5‑72B는 전반적으로 동료 모델들을 능가하며, 파라미터가 약 1/5 수준인 상황에서도 Llama‑3‑405B와 비슷한 점수를 기록합니다. 주요 결과:
- MMLU: 86.1 (Qwen2‑72B 84.2, Llama‑3‑405B 85.2 대비)
- BBH: 86.3 (Qwen2‑72B 82.4 대비)
- GPQA: 45.9 (37.4 대비)
- MATH: 62.1 (50.9 대비)
- HumanEval: 59.1 (Qwen2‑72B 64.6 대비, 다수 오픈 모델보다 높음)
- Multilingual: Multi‑Exam 78.7, Multi‑Understanding 89.6 에서 최고 점수 기록.
중간 규모 모델
- Qwen2.5‑14B는 MMLU(79.7)와 BBH(78.2)에서 Qwen1.5‑32B 및 기타 14‑30B 오픈 모델을 앞섭니다.
- Qwen2.5‑32B는 Qwen2‑57B‑A14B를 능가하며, 다수 과제에서 Llama‑3‑70B 수준의 성능을 달성합니다 (예: MMLU 83.3, GSM8K 92.9, MBPP 84.5).
7B 모델
Qwen2.5‑7B는 파라미터가 동일함에도 불구하고 Qwen2‑7B보다 개선되었습니다. 주요 점수: MMLU 74.2, MATH 49.8, HumanEval 57.9.
엣지 사이드 모델 (≤3B)
0.5B, 1.5B, 3B 모델 모두 Qwen2 대비 일관된 향상을 보이며, 특히 코딩(HumanEval 42.1 → 74.4 for 3B)과 수학(MATH 19.5 → 42.6 for 3B)에서 큰 개선이 나타났습니다.
인스트럭션 튜닝 모델
Qwen2.5‑72B‑Instruct
- Arena‑Hard: 81.2 (Qwen2‑72B‑Instruct 48.1 대비)
- MATH: 83.1 (69.0 대비)
- LiveCodeBench: 55.5 (32.2 대비)
- MT‑Bench: 9.35 (9.12 대비)
- 여러 지표에서 Llama‑3.1‑405B‑Instruct를 능가합니다 (예: MMLU‑Pro 71.1 vs. 73.3 for Llama‑3.1‑405B‑Instruct).
Qwen‑Turbo, Qwen2.5‑14B‑Instruct, Qwen2.5‑32B‑Instruct
- Qwen2.5‑32B‑Instruct는 유사 규모 오픈 모델 중 가장 높은 점수를 기록합니다 (예: MMLU‑Pro 69.0, GSM8K 95.9, HumanEval 88.4).
- Qwen‑Turbo(API)는 다수 벤치마크에서 GPT‑4o‑mini와 견줄 만한 경쟁력을 제공하면서도 오픈‑소스입니다.
7B, 3B, 1.5B, 0.5B 인스트럭션 모델
소형 인스트럭션 모델 모두 기본 버전 대비 큰 상대적 향상을 보여, 자원 제한 환경에서도 활용 가능함을 증명합니다. 주요 예시:
- Qwen2.5‑7B‑Instruct: MATH 75.5, HumanEval 84.8.
- Qwen2.5‑3B‑Instruct: 코딩(HumanEval 74.4) 및 수학(MATH 65.9)에서 대형 상용 모델에 근접.
- Qwen2.5‑1.5B‑Instruct: HumanEval 61.6, MATH 55.2 – Qwen2‑1.5B‑Instruct 대비 20점 이상 상승.
다국어 능력
시리즈는 번역된 IFEval, 언어별 MMLU 변형, 확장된 MGSM8K, 문화적 뉘앙스 벤치마크 BLEnD 등에서 평가되었습니다. 72B 인스트럭션 모델은 다국어 IFEval에서 86.98, 일본어 JMMLU에서 80.56 등 경쟁 모델 중 최고 점수를 기록했습니다. 14B와 7B 인스트럭션 모델도 다수 언어에서 대형 상용 시스템과 격차를 좁혔습니다.
새 기능 시연
- JSON generation – 모델이 구문적으로 올바른 JSON 구조를 안정적으로 생성하여 툴‑콜링 파이프라인에 유용합니다.
- Long‑form generation – 8 K 토큰 생성 제한으로 에세이, 보고서, 코드베이스 등을 잘라내지 않고 생성할 수 있습니다.
- Structured data understanding – 표 파싱 및 다중 열 추론 능력이 크게 향상되어 데모 스위트에서 확인할 수 있습니다.
LLM 환경에 대한 시사점
- Open‑source competitiveness – 14B와 32B 체크포인트가 다수 상용 모델을 앞서면서, 오픈과 폐쇄 생태계 간 격차가 좁혀집니다.
- Production‑ready middle tier – 10‑30B 범위가 완전 오픈 모델로 커버되어, 자체 호스팅 LLM을 원하는 기업의 진입 장벽이 낮아집니다.
- Edge deployment – 3B 모델은 모바일·임베디드 디바이스에 적합한 footprint에서 강력한 코딩·수학 능력을 제공합니다.
- Alignment progress – Arena‑Hard와 MT‑Bench에서의 큰 상승은 오픈‑소스 인스트럭션 튜닝이 선도적인 폐쇄 모델과 동등한 인간 선호 정렬을 달성할 수 있음을 보여줍니다.
모델 다운로드 위치
- GitHub – https://github.com/QwenLM/Qwen2.5
- Hugging Face – https://huggingface.co/Qwen
- ModelScope – https://modelscope.cn/organization/qwen
- Demo – https://huggingface.co/spaces/Qwen/Qwen2.5-72B-Instruct
- API (Qwen‑Turbo, Qwen‑Plus) – Alibaba Cloud Model Studio.
모든 숫자와 표는 Qwen2.5 발표 자료에서 그대로 재현했으며, 추가적인 주장이나 내용은 포함되지 않았습니다.