Qwen1.5-32B 發布說明 / 有什麼新功能
Qwen 推出了 Qwen1.5-32B 與 Qwen1.5-32B-Chat,提供高效能的替代方案,以降低記憶體消耗、推論延遲與微調成本。這些模型定位為「甜 spot」給那些覺得 14B 模型在諸如代理情境等複雜任務上不足,而 72B 模型又過於資源密集的使用者。
技術架構與效能
Qwen1.5-32B 保持與 Qwen1.5 系列其他模型相同的一般架構,唯一主要差異是加入了 Grouped Query Attention(GQA)。GQA 的實作使模型服務更有效率,且相較於標準注意力機制提升了推論效能。
效能基準
Qwen1.5-32B 在基礎、聊天與多語言評估中展現出具競爭力的能力,常在 30B 參數範圍內超越其他模型。
基礎模型能力
在基礎能力評估中,Qwen1.5-32B 在多數任務上優於 Llama2-34B 與 Mixtral-8x7B。雖然其表現略低於 Qwen1.5-72B 模型,但在推理與程式碼基準測試中仍具高度競爭力:
| 模型 | MMLU | C-Eval | GSM8K | MATH | HumanEval | MBPP | BBH | CMMLU |
|---|---|---|---|---|---|---|---|---|
| Qwen1.5-32B | 73.4 | 83.5 | 77.4 | 36.1 | 37.2 | 49.4 | 66.8 | 82.3 |
| Qwen1.5-72B | 77.5 | 84.1 | 79.5 | 34.1 | 41.5 | 53.4 | 65.5 | 83.5 |
| Mixtral-8x7B | 70.6 | - | 74.4 | 28.4 | 40.2 | 60.7 | - | - |
| Yi-34B | 76.3 | 81.4 | 67.2 | 14.4 | 23.2 | 41.0 | 54.3 | 83.7 |
| Llama2-34B | 62.6 | - | 42.2 | 6.2 | 22.6 | 33.0 | 44.1 | - |
聊天模型評估
Qwen1.5-32B-Chat 採用先進的後訓練技術,包括 RLHF,以提升對話能力。其在 MT-Bench 上取得超過 8 分的成績,與 72B-Chat 變體相比,性能差距相對較小:
| 模型 | MT-Bench(平均分) | AlpacaEval 2.0(LC 勝率) |
|---|---|---|
| Qwen1.5-32B-Chat | 8.30 | 27.49 |
| Qwen1.5-72B-Chat | 8.61 | 36.60 |
多語言與長上下文效能
Qwen1.5-32B 支援 12 種語言,包括阿拉伯語、西班牙語、法語、葡萄牙語、德語、義大利語、俄語、日語、韓語、越南語、泰語與印尼語。其在考試、理解、數學與翻譯等方面的平均表現為 56.91,高於 Mixtral-8x7B(50.39),略低於 Qwen1.5-72B(60.44)。
此外,該模型在「大海撈針」評估中,對長度最高達 32K 令牌的上下文亦能達到頂級表現。