Qwen2.5-Coder 릴리스 노트

Qwen은 민첩한 코딩 파트너 역할을 위해 설계된 차세대 오픈소스 코딩 모델 시리즈인 Qwen2.5-Coder의 출시를 발표했습니다. 이 시리즈는 1.5B와 7B 크기로 제공되며, 32B 버전은 향후 출시될 예정입니다.

기술 기반 및 학습

Qwen2.5-Coder는 Qwen2.5 베이스 위에 구축되었으며 5.5조 토큰의 방대한 데이터셋으로 학습되었습니다. 이 학습 코퍼스에는 소스 코드, 합성 데이터, 텍스트-코드 정합 데이터가 포함되어 있어 특화된 코딩 능력을 강화합니다. 모델이 Code Agents와 같은 실제 응용 분야에서도 다재다능하도록 하기 위해, 학습에는 수학 및 일반 능력에 초점을 맞춘 추가 데이터도 포함되었습니다.

기본 모델 기능

Qwen2.5-Coder 기본 모델은 최대 128K 토큰의 컨텍스트 윈도우를 지원하며 92개의 프로그래밍 언어를 포괄합니다. 이러한 모델은 여러 핵심 영역에서 상당한 개선을 보여줍니다:

  • 코드 작업: 모델은 코드 생성, 다중 프로그래밍 코드 생성, 코드 완성 및 코드 수리에서 뛰어난 성능을 보입니다.
  • 경쟁력 있는 성능: Qwen2.5-Coder 7B 버전은 DeepSeek-Coder-V2-Lite 및 CodeStral-22B와 같은 더 큰 모델보다 다양한 코드 관련 평가 작업에서 우수한 성능을 보입니다.
  • 일반 숙련도: 모델은 MMLU와 ARC 평가에서 확인된 Qwen2.5의 일반 능력 성능을 유지하면서, GSM8K 및 Math와 같은 수학 벤치마크에서도 경쟁력을 유지합니다.

Qwen2.5-Coder-Instruct 향상점

Qwen2.5-Coder-Instruct는 기본 모델의 지시 튜닝 버전으로, 벤치마크 전반에 걸쳐 향상된 작업 성능과 일반화를 제공합니다.

다중 프로그래밍 및 추론

McEval를 사용해 40개 이상의 프로그래밍 언어를 포괄함으로써, Qwen2.5-Coder-Instruct는 인기 언어와 틈새 언어 모두에서 전문가임이 입증되었습니다. 또한, CRUXEval을 통한 평가에서 모델이 코드 추론에 뛰어난 성능을 보인다는 것이 확인되었습니다. 개발자들은 향상된 코드 추론 능력과 복잡한 지시를 따르는 능력 사이에 상관관계가 있음을 언급했습니다.

수학 및 일반 지능

Qwen2.5-Coder-Instruct는 "과학 학생"으로서 강력한 성능을 보여주며, 수학적 기초와 코딩 도구 사이의 격차를 메웁니다. DeepSeek-Coder-V2-Lite-Instruct와의 직접 비교에서, Qwen2.5-Coder-7B-Instruct 모델은 여러 벤치마크에서 우수한 결과를 나타냈습니다:

벤치마크 Qwen2.5-Coder-7B-Instruct DeepSeek-Coder-V2-Lite-Instruct
수학 66.8 61.0
GaoKao2023en 60.5 56.1
OlympiadBench 29.8 26.4
CollegeMath 43.5 39.8
AIME24 10.0 6.7

일반 능력 벤치마크에서도 7B-Instruct 모델이 우위를 보이며, MMLU(68.7 vs 60.6), IFEval(58.6 vs 38.6), GPQA(35.6 vs 27.6)에서 더 높은 점수를 기록했습니다.

라이선스 및 제공

Qwen2.5-Coder는 코드 인텔리전스 분야의 광범위한 적용을 장려하기 위해 Apache 2.0 라이선스로 출시되었습니다. 1.5B와 7B 모델은 현재 제공 중이며, 32B 버전은 곧 출시되어 독점 모델에 도전할 예정입니다.

Sources