Qwen2 릴리즈 노트 / 새로운 소식
Qwen은 Qwen1.5 시리즈의 진화형인 Qwen2를 출시했습니다. 이 시리즈는 0.5B, 1.5B, 7B, 57B‑A14B, 72B의 다섯 가지 모델 크기를 제공하며, 코딩, 수학, 다국어 이해 성능을 향상시키도록 설계되었습니다. 모든 모델에 Group Query Attention (GQA)을 적용해 추론 속도와 메모리 사용량을 최적화했으며, 영어와 중국어 외에 27개의 추가 언어를 학습 데이터에 포함시켰습니다.
모델 아키텍처 및 사양
Qwen2는 다양한 파라미터 수와 컨텍스트 윈도우를 지원하는 기본 모델과 인스트럭션 튜닝 모델을 도입합니다. 주요 아키텍처 업데이트는 모든 모델에 적용된 Group Query Attention (GQA)으로, 메모리 오버헤드를 줄이고 추론 속도를 높입니다.
| 모델 | 파라미터 | 비임베딩 파라미터 | GQA | 임베딩 연결 | 컨텍스트 길이 |
|---|---|---|---|---|---|
| Qwen2-0.5B | 0.49B | 0.35B | True | True | 32K |
| Qwen2-1.5B | 1.54B | 1.31B | True | True | 32K |
| Qwen2-7B | 7.07B | 5.98B | True | False | 128K |
| Qwen2-57B-A14B | 57.41B | 56.32B | True | False | 64K |
| Qwen2-72B | 72.71B | 70.21B | True | False | 128K |
소형 모델(0.5B 및 1.5B)의 경우, Qwen은 큰 희소 임베딩이 전체 파라미터 수를 압도하지 않도록 임베딩을 연결(tie)합니다.
다국어 확장 및 코드 스위칭
Qwen2는 전 세계적인 활용도를 높이기 위해 27개의 추가 언어로 학습되었습니다. 주요 지역별 확장은 다음과 같습니다:
- 서유럽: 독일어, 프랑스어, 스페인어, 포르투갈어, 이탈리아어, 네덜란드어
- 동·중부 유럽: 러시아어, 체코어, 폴란드어
- 중동: 아랍어, 페르시아어, 히브리어, 터키어
- 동아시아: 일본어, 한국어
- 동남아시아: 베트남어, 태국어, 인도네시아어, 말레이어, 라오어, 버마어, 세부아노어, 크메르어, 타갈로그어
- 남아시아: 힌디어, 벵골어, 우르두어
언어를 추가하는 것 외에도, 팀은 하나의 프롬프트 내에서 여러 언어를 혼합하는 "코드 스위칭" 처리 능력을 개선하는 데 집중했으며, 그 결과 다국어 평가에서 관련 오류가 크게 감소했습니다.
성능 벤치마크
대규모 모델 성능 (Qwen2-72B)
Qwen2-72B는 파라미터 수가 적음에도 불구하고 이전 모델인 Qwen1.5-110B보다 뛰어난 성능을 보여줍니다. 기본 모델 평가에서 Qwen2-72B는 MMLU(84.2 vs 79.5)와 HumanEval(64.6 vs 48.2) 등 여러 지표에서 Llama-3-70B를 앞섭니다.
인스트럭션 튜닝 모델 능력
Qwen2-72B-Instruct는 Qwen1.5-72B-Chat보다 크게 개선되었으며, Llama-3-70B-Instruct와도 경쟁력을 유지합니다. 주요 하이라이트는 다음과 같습니다:
- 코딩 및 수학: CodeQwen1.5 데이터를 통합해 프로그래밍 능력이 향상되었습니다. Qwen2-72B-Instruct는 MATH에서 59.7점을 기록했으며, Llama-3-70B-Instruct의 50.4점보다 높습니다.
- 추론: 모델은 Arena-Hard(48.1)와 MT-Bench(9.12)에서 강력한 성능을 보입니다.
소형 및 중형 모델
Qwen2-7B-Instruct는 특히 코딩 및 중국어 관련 지표에서 동급 SOTA 모델을 앞섭니다. Qwen2-0.5B와 1.5B도 이전 버전 대비 향상을 보였으며, Qwen2-1.5B-Instruct는 MMLU에서 52.4점을 달성했습니다.
긴 컨텍스트 이해
모든 인스트럭션 튜닝 모델은 32K 토큰 컨텍스트에서 사전 학습되었습니다. YARN과 Dual Chunk Attention을 활용해 모델은 더 긴 시퀀스를 처리하도록 확장되었습니다:
- Qwen2-72B-Instruct 및 Qwen2-7B-Instruct: 최대 128K 토큰을 지원하며, "Needle in a Haystack" 테스트에서 거의 완벽에 가까운 정보 추출을 보여줍니다.
- Qwen2-57B-A14B-Instruct: 최대 64K 토큰을 지원합니다.
- 소형 모델(0.5B/1.5B): 최대 32K 토큰을 지원합니다.
안전 및 다국어 책임
Qwen2-72B-Instruct는 도움이 되면서도 정직하고 해가 없도록 설계되었습니다. 다국어 안전성 평가(불법 활동, 사기, 포르노, 프라이버시 폭력)에서 Qwen2-72B-Instruct는 GPT‑4와 비슷한 수준을 보였으며, Mistral-8x22B보다 크게 앞섰습니다. 예를 들어, "불법 활동" 카테고리에서는 모든 테스트 언어에서 0% 유해 응답률을 유지해 GPT‑4와 동일한 결과를 기록했습니다.
라이선스 및 이용 가능성
Qwen은 상업적 채택을 확대하기 위해 시리즈의 라이선스를 업데이트했습니다:
- Apache 2.0: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B에 적용됩니다.
- Qianwen License: Qwen2-72B 및 해당 인스트럭션 튜닝 변형에 유지됩니다.
모델은 Hugging Face와 ModelScope에서 이용할 수 있습니다.
Sources
- OriginalHello Qwen2