Qwen1.5-110B 릴리스 노트 / 새로운 내용
Qwen은 Qwen1.5-110B를 출시했습니다. 이는 Qwen1.5 시리즈에서 처음으로 1000억 파라미터를 초과한 모델이며, 기본 능력과 채팅 기반 상호작용 모두에서 모델 크기 확대가 성능 향상을 지속적으로 제공한다는 것을 보여줍니다. 이 모델은 Llama-3-70B와 같은 다른 대규모 오픈소스 모델에 대한 경쟁력 있는 대안으로 자리매김합니다.
모델 아키텍처 및 기술 사양
Qwen1.5-110B는 Qwen1.5 시리즈의 다른 모델과 유사한 Transformer 디코더 아키텍처를 사용합니다. 주요 기술 사양은 다음과 같습니다:
- Grouped Query Attention (GQA): 모델은 GQA를 도입하여 모델 서빙 시 효율성을 보장합니다.
- Context Window: 32K 토큰의 컨텍스트 길이를 지원합니다.
- Multilingual Support: 모델은 다국어 기능을 유지하며 영어, 중국어, 프랑스어, 스페인어, 독일어, 러시아어, 한국어, 일본어, 베트남어, 아랍어 등 다양한 언어를 지원합니다.
기본 모델 성능
Qwen1.5-110B는 여러 벤치마크에서 Meta-Llama3-70B 및 Mixtral-8x22B와 경쟁합니다. Qwen 팀은 사전 학습 및 사후 학습 레시피를 크게 변경하지 않고 모델 크기를 늘림으로써 Qwen1.5-72B 모델 대비 성능 향상을 달성했다고 밝혔습니다.
| 벤치마크 | Qwen1.5-110B | Qwen1.5-72B | Llama-3-70B | Mixtral-8x22B |
|---|---|---|---|---|
| MMLU | 80.4 | 77.5 | 79.5 | 77.8 |
| TheoremQA | 34.9 | 29.3 | 32.0 | 35.9 |
| GPQA | 35.9 | 36.3 | 36.4 | 34.3 |
| Hellaswag | 87.5 | 86.0 | 88.0 | 88.7 |
| BBH | 74.8 | 65.5 | 76.6 | 69.2 |
| ARC-C | 69.6 | 65.9 | 68.8 | 70.7 |
| GSM8K | 85.4 | 79.5 | 79.2 | 78.6 |
| MATH | 49.6 | 34.1 | 41.0 | 41.7 |
| HumanEval | 52.4 | 41.5 | 45.7 | 45.1 |
| MBPP | 58.1 | 53.4 | 55.1 | 71.2 |
챗 모델 평가
채팅 전용 평가에서 Qwen1.5-110B-Chat은 Qwen1.5-72B-Chat 모델에 비해 크게 개선되었습니다. MT-Bench와 AlpacaEval 2.0 모두에서 Llama-3-70B-Instruct를 능가합니다.
| 모델 | MT-Bench (평균 점수) | AlpacaEval 2.0 (LC 승률) |
|---|---|---|
| Llama-3-70B-Instruct | 8.85 | 34.40 |
| Qwen1.5-72B-Chat | 8.61 | 36.60 |
| Qwen1.5-110B-Chat | 8.88 | 43.90 |
모델 스케일링에 대한 시사점
Qwen1.5-110B의 출시로 모델 크기 확대를 통한 성능 향상의 여지가 여전히 크다는 점이 확인되었습니다. Qwen 팀은 Llama-3이 보여준 데이터 스케일링의 중요성을 인식하면서, 향후 릴리스(예: 곧 출시될 Qwen2)에서는 데이터와 모델 크기를 모두 확대하는 전략을 추구할 계획입니다.
SUMMARY: Qwen은 Qwen1.5 시리즈에서 처음으로 1000억 파라미터를 초과한 Qwen1.5-110B를 출시했으며, Llama-3-70B와 경쟁력 있는 성능을 제공하고 Qwen1.5-72B에 비해 크게 향상되었습니다.
TITLE: Qwen1.5-110B 릴리스 노트 / 새로운 내용