Qwen2.5 LLM 시리즈 출시

TL;DR

Qwen은 Qwen2.5 시리즈를 발표했습니다 – 0.5B에서 72B 파라미터까지의 디코더‑전용 LLM 패밀리로, 이전 Qwen2 모델보다 최대 두 배의 성능을 제공하면서 3B, 14B, 32B 크기는 완전 오픈‑소스입니다. 업그레이드에는 18조 토큰 규모의 대규모 사전학습 코퍼스, 지식·코딩·수학·정렬에서의 큰 향상, 그리고 최대 128K 토큰의 컨텍스트 윈도우가 포함됩니다.

Qwen2.5 릴리스 개요

  • Model lineup – 7개의 오픈‑소스 모델 (0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B). 3B, 14B, 32B 체크포인트는 프로덕션‑그레이드(10‑30B)와 모바일‑사이드(≈3B) 워크로드 수요를 충족하기 위해 새롭게 추가되었습니다.
  • Licensing – 모든 모델은 Apache‑2.0 라이선스를 사용하지만 Qwen2.5‑3B는 Qwen Research License, Qwen2.5‑72B는 Qwen License를 적용합니다.
  • Context & generation – 컨텍스트 길이는 최대 128 K 토큰, 생성 길이는 최대 8 K 토큰으로, 장문 출력이 가능합니다.
  • Access – 오픈‑소스 체크포인트 외에도 Qwen‑Plus와 Qwen‑Turbo가 Alibaba Cloud Model Studio API를 통해 제공됩니다.

Qwen2 대비 기술적 개선 사항

업그레이드 상세
Dataset size 사전학습 데이터가 7 T 토큰에서 최대 18 T 토큰으로 증가했습니다.
Knowledge MMLU 점수가 70.3 → 74.2 (7B) 및 84.2 → 86.1 (72B) 로 상승했습니다. GPQA, MMLU‑Pro, MMLU‑Redux, ARC‑C에서도 개선이 관찰되었습니다.
Coding Qwen2.5‑Coder가 도입되었습니다. Qwen2.5‑72B‑Instruct는 LiveCodeBench 55.5, MultiPL‑E 75.1, MBPP 88.2 점수를 기록하며 Qwen2‑72B‑Instruct(32.2, 69.2, 80.2)를 능가합니다.
Mathematics Qwen2‑math 기술이 통합되었습니다. MATH 벤치마크 점수가 75.5 (7B) 및 83.1 (72B) 로 52.9 / 69.0에서 크게 상승했습니다.
Alignment Arena‑Hard 점수가 48.1 → 81.2, MT‑Bench가 9.12 → 9.35 로 72B 인스트럭션 모델에서 크게 향상되었습니다.
Other capabilities 명령 수행, 장문 생성 (1 K → 8 K 토큰), 표 이해, JSON 생성, 다양한 시스템 프롬프트에 대한 견고성 등이 모두 현저히 개선되었습니다.

모델 카드 하이라이트

Model Params Layers Heads (KV) Context Generation License
Qwen2.5‑0.5B 0.49 B 24 14/2 32 K 8 K Apache 2.0
Qwen2.5‑1.5B 1.54 B 28 12/2 32 K 8 K Apache 2.0
Qwen2.5‑3B 3.09 B 36 16/2 32 K 8 K Qwen Research
Qwen2.5‑7B 7.61 B 28 28/4 128 K 8 K Apache 2.0
Qwen2.5‑14B 14.7 B 48 40/8 128 K 8 K Apache 2.0
Qwen2.5‑32B 32.5 B 64 40/8 128 K 8 K Apache 2.0
Qwen2.5‑72B 72.7 B 80 64/8 128 K 8 K Qwen

벤치마크 성능 – 기본 모델

72B 모델

Qwen2.5‑72B는 전반적으로 동료 모델들을 능가하며, 파라미터가 약 1/5 수준인 상황에서도 Llama‑3‑405B와 비슷한 점수를 기록합니다. 주요 결과:

  • MMLU: 86.1 (Qwen2‑72B 84.2, Llama‑3‑405B 85.2 대비)
  • BBH: 86.3 (Qwen2‑72B 82.4 대비)
  • GPQA: 45.9 (37.4 대비)
  • MATH: 62.1 (50.9 대비)
  • HumanEval: 59.1 (Qwen2‑72B 64.6 대비, 다수 오픈 모델보다 높음)
  • Multilingual: Multi‑Exam 78.7, Multi‑Understanding 89.6 에서 최고 점수 기록.

중간 규모 모델

  • Qwen2.5‑14B는 MMLU(79.7)와 BBH(78.2)에서 Qwen1.5‑32B 및 기타 14‑30B 오픈 모델을 앞섭니다.
  • Qwen2.5‑32B는 Qwen2‑57B‑A14B를 능가하며, 다수 과제에서 Llama‑3‑70B 수준의 성능을 달성합니다 (예: MMLU 83.3, GSM8K 92.9, MBPP 84.5).

7B 모델

Qwen2.5‑7B는 파라미터가 동일함에도 불구하고 Qwen2‑7B보다 개선되었습니다. 주요 점수: MMLU 74.2, MATH 49.8, HumanEval 57.9.

엣지 사이드 모델 (≤3B)

0.5B, 1.5B, 3B 모델 모두 Qwen2 대비 일관된 향상을 보이며, 특히 코딩(HumanEval 42.1 → 74.4 for 3B)과 수학(MATH 19.5 → 42.6 for 3B)에서 큰 개선이 나타났습니다.

인스트럭션 튜닝 모델

Qwen2.5‑72B‑Instruct

  • Arena‑Hard: 81.2 (Qwen2‑72B‑Instruct 48.1 대비)
  • MATH: 83.1 (69.0 대비)
  • LiveCodeBench: 55.5 (32.2 대비)
  • MT‑Bench: 9.35 (9.12 대비)
  • 여러 지표에서 Llama‑3.1‑405B‑Instruct를 능가합니다 (예: MMLU‑Pro 71.1 vs. 73.3 for Llama‑3.1‑405B‑Instruct).

Qwen‑Turbo, Qwen2.5‑14B‑Instruct, Qwen2.5‑32B‑Instruct

  • Qwen2.5‑32B‑Instruct는 유사 규모 오픈 모델 중 가장 높은 점수를 기록합니다 (예: MMLU‑Pro 69.0, GSM8K 95.9, HumanEval 88.4).
  • Qwen‑Turbo(API)는 다수 벤치마크에서 GPT‑4o‑mini와 견줄 만한 경쟁력을 제공하면서도 오픈‑소스입니다.

7B, 3B, 1.5B, 0.5B 인스트럭션 모델

소형 인스트럭션 모델 모두 기본 버전 대비 큰 상대적 향상을 보여, 자원 제한 환경에서도 활용 가능함을 증명합니다. 주요 예시:

  • Qwen2.5‑7B‑Instruct: MATH 75.5, HumanEval 84.8.
  • Qwen2.5‑3B‑Instruct: 코딩(HumanEval 74.4) 및 수학(MATH 65.9)에서 대형 상용 모델에 근접.
  • Qwen2.5‑1.5B‑Instruct: HumanEval 61.6, MATH 55.2 – Qwen2‑1.5B‑Instruct 대비 20점 이상 상승.

다국어 능력

시리즈는 번역된 IFEval, 언어별 MMLU 변형, 확장된 MGSM8K, 문화적 뉘앙스 벤치마크 BLEnD 등에서 평가되었습니다. 72B 인스트럭션 모델은 다국어 IFEval에서 86.98, 일본어 JMMLU에서 80.56 등 경쟁 모델 중 최고 점수를 기록했습니다. 14B와 7B 인스트럭션 모델도 다수 언어에서 대형 상용 시스템과 격차를 좁혔습니다.

새 기능 시연

  • JSON generation – 모델이 구문적으로 올바른 JSON 구조를 안정적으로 생성하여 툴‑콜링 파이프라인에 유용합니다.
  • Long‑form generation – 8 K 토큰 생성 제한으로 에세이, 보고서, 코드베이스 등을 잘라내지 않고 생성할 수 있습니다.
  • Structured data understanding – 표 파싱 및 다중 열 추론 능력이 크게 향상되어 데모 스위트에서 확인할 수 있습니다.

LLM 환경에 대한 시사점

  • Open‑source competitiveness – 14B와 32B 체크포인트가 다수 상용 모델을 앞서면서, 오픈과 폐쇄 생태계 간 격차가 좁혀집니다.
  • Production‑ready middle tier – 10‑30B 범위가 완전 오픈 모델로 커버되어, 자체 호스팅 LLM을 원하는 기업의 진입 장벽이 낮아집니다.
  • Edge deployment – 3B 모델은 모바일·임베디드 디바이스에 적합한 footprint에서 강력한 코딩·수학 능력을 제공합니다.
  • Alignment progress – Arena‑Hard와 MT‑Bench에서의 큰 상승은 오픈‑소스 인스트럭션 튜닝이 선도적인 폐쇄 모델과 동등한 인간 선호 정렬을 달성할 수 있음을 보여줍니다.

모델 다운로드 위치


모든 숫자와 표는 Qwen2.5 발표 자료에서 그대로 재현했으며, 추가적인 주장이나 내용은 포함되지 않았습니다.

Sources