Qwen1.5-32B 릴리스 노트 / 새로운 점
Qwen은 Qwen1.5-32B와 Qwen1.5-32B-Chat을 도입하여, 메모리 사용량, 추론 지연 시간 및 파인튜닝 비용을 줄이면서 대형 모델에 대한 고성능 대안을 제공합니다. 이 모델들은 14B 모델이 복잡한 작업(예: 에이전트 시나리오)에는 부족하고 72B 모델은 자원 소모가 많다고 느끼는 사용자들을 위한 "최적의 지점"으로 자리매김합니다.
기술 아키텍처 및 효율성
Qwen1.5-32B는 Qwen1.5 시리즈의 다른 모델들과 동일한 일반 아키텍처를 유지하지만, 주요 차이점은 Grouped Query Attention(GQA)의 도입입니다. GQA 구현은 표준 어텐션 메커니즘에 비해 모델 서빙 효율성을 높이고 추론 성능을 개선합니다.
성능 벤치마크
Qwen1.5-32B는 기본, 챗, 다국어 평가 전반에 걸쳐 경쟁력 있는 능력을 보여주며, 30B 파라미터 범위의 다른 모델들을 종종 능가합니다.
기본 모델 능력
기본 능력 평가에서 Qwen1.5-32B는 대부분의 작업에서 Llama2-34B와 Mixtral-8x7B보다 우수한 성능을 보입니다. Qwen1.5-72B 모델보다 약간 낮은 수준이지만, 추론 및 코딩 벤치마크에서는 여전히 높은 경쟁력을 유지합니다:
| 모델 | MMLU | C-Eval | GSM8K | MATH | HumanEval | MBPP | BBH | CMMLU |
|---|---|---|---|---|---|---|---|---|
| Qwen1.5-32B | 73.4 | 83.5 | 77.4 | 36.1 | 37.2 | 49.4 | 66.8 | 82.3 |
| Qwen1.5-72B | 77.5 | 84.1 | 79.5 | 34.1 | 41.5 | 53.4 | 65.5 | 83.5 |
| Mixtral-8x7B | 70.6 | - | 74.4 | 28.4 | 40.2 | 60.7 | - | - |
| Yi-34B | 76.3 | 81.4 | 67.2 | 14.4 | 23.2 | 41.0 | 54.3 | 83.7 |
| Llama2-34B | 62.6 | - | 42.2 | 6.2 | 22.6 | 33.0 | 44.1 | - |
챗 모델 평가
Qwen1.5-32B-Chat은 RLHF를 포함한 고급 사후 학습 기법을 활용해 대화 능력을 강화했습니다. MT-Bench에서 8점을 초과하는 점수를 기록했으며, 72B-Chat 변형에 비해 성능 차이가 비교적 작습니다:
| 모델 | MT-Bench (평균 점수) | AlpacaEval 2.0 (LC 승률) |
|---|---|---|
| Qwen1.5-32B-Chat | 8.30 | 27.49 |
| Qwen1.5-72B-Chat | 8.61 | 36.60 |
다국어 및 장문 컨텍스트 성능
Qwen1.5-32B는 아랍어, 스페인어, 프랑스어, 포르투갈어, 독일어, 이탈리아어, 러시아어, 일본어, 한국어, 베트남어, 태국어, 인도네시아어 등 12개 언어를 지원합니다. 시험, 이해, 수학, 번역 전반에 걸친 평균 성능은 56.91로, Mixtral-8x7B(50.39)보다 높고 Qwen1.5-72B(60.44)보다 약간 낮습니다.
또한, 이 모델은 최대 32K 토큰 길이의 컨텍스트에 대해 "건초 더미 속의 바늘" 평가에서 최상위 수준의 성능을 달성합니다.