Qwen1.5-110B 版本說明 / 新功能
模型架構與技術規格
Qwen1.5-110B 採用與 Qwen1.5 系列其他模型相似的 Transformer 解碼器架構。主要技術規格包括:
- Grouped Query Attention (GQA): 模型加入 GQA 以確保模型服務時的效率。
- Context Window(上下文窗口): 支援 32K 令牌的上下文長度。
- Multilingual Support(多語言支援): 模型保有多語言能力,支援包括英語、中文、法語、西班牙語、德語、俄語、韓語、日語、越南語與阿拉伯語等多種語言。
基礎模型效能
Qwen1.5-110B 在多項基準測試中與 Meta-Llama3-70B 與 Mixtral-8x22B 具競爭力。Qwen 團隊指出,較 Qwen1.5-72B 模型的效能提升是透過擴大模型規模,而非大幅改變預訓練與後訓練流程而達成的。
| 基準測試 | Qwen1.5-110B | Qwen1.5-72B | Llama-3-70B | Mixtral-8x22B |
|---|---|---|---|---|
| MMLU | 80.4 | 77.5 | 79.5 | 77.8 |
| TheoremQA | 34.9 | 29.3 | 32.0 | 35.9 |
| GPQA | 35.9 | 36.3 | 36.4 | 34.3 |
| Hellaswag | 87.5 | 86.0 | 88.0 | 88.7 |
| BBH | 74.8 | 65.5 | 76.6 | 69.2 |
| ARC-C | 69.6 | 65.9 | 68.8 | 70.7 |
| GSM8K | 85.4 | 79.5 | 79.2 | 78.6 |
| MATH | 49.6 | 34.1 | 41.0 | 41.7 |
| HumanEval | 52.4 | 41.5 | 45.7 | 45.1 |
| MBPP | 58.1 | 53.4 | 55.1 | 71.2 |
聊天模型評估
在聊天專屬評估中,Qwen1.5-110B-Chat 相較於 Qwen1.5-72B-Chat 模型顯著提升。它在 MT-Bench 與 AlpacaEval 2.0 兩項測試中均優於 Llama-3-70B-Instruct。
| 模型 | MT-Bench(平均分數) | AlpacaEval 2.0(LC 勝率) |
|---|---|---|
| Llama-3-70B-Instruct | 8.85 | 34.40 |
| Qwen1.5-72B-Chat | 8.61 | 36.60 |
| Qwen1.5-110B-Chat | 8.88 | 43.90 |
模型擴展的意涵
Qwen1.5-110B 的發布顯示,透過模型規模擴大仍有相當大的效能提升空間。雖然 Qwen 團隊承認 Llama-3 所示的資料規模擴大的重要性,但他們計畫在未來的發布(包括即將推出的 Qwen2)中,同時擴大資料與模型規模以作為策略。