Qwen1.5-32B 發布說明 / 有什麼新功能

Qwen 推出了 Qwen1.5-32B 與 Qwen1.5-32B-Chat,提供高效能的替代方案,以降低記憶體消耗、推論延遲與微調成本。這些模型定位為「甜 spot」給那些覺得 14B 模型在諸如代理情境等複雜任務上不足,而 72B 模型又過於資源密集的使用者。

技術架構與效能

Qwen1.5-32B 保持與 Qwen1.5 系列其他模型相同的一般架構,唯一主要差異是加入了 Grouped Query Attention(GQA)。GQA 的實作使模型服務更有效率,且相較於標準注意力機制提升了推論效能。

效能基準

Qwen1.5-32B 在基礎、聊天與多語言評估中展現出具競爭力的能力,常在 30B 參數範圍內超越其他模型。

基礎模型能力

在基礎能力評估中,Qwen1.5-32B 在多數任務上優於 Llama2-34B 與 Mixtral-8x7B。雖然其表現略低於 Qwen1.5-72B 模型,但在推理與程式碼基準測試中仍具高度競爭力:

模型 MMLU C-Eval GSM8K MATH HumanEval MBPP BBH CMMLU
Qwen1.5-32B 73.4 83.5 77.4 36.1 37.2 49.4 66.8 82.3
Qwen1.5-72B 77.5 84.1 79.5 34.1 41.5 53.4 65.5 83.5
Mixtral-8x7B 70.6 - 74.4 28.4 40.2 60.7 - -
Yi-34B 76.3 81.4 67.2 14.4 23.2 41.0 54.3 83.7
Llama2-34B 62.6 - 42.2 6.2 22.6 33.0 44.1 -

聊天模型評估

Qwen1.5-32B-Chat 採用先進的後訓練技術,包括 RLHF,以提升對話能力。其在 MT-Bench 上取得超過 8 分的成績,與 72B-Chat 變體相比,性能差距相對較小:

模型 MT-Bench(平均分) AlpacaEval 2.0(LC 勝率)
Qwen1.5-32B-Chat 8.30 27.49
Qwen1.5-72B-Chat 8.61 36.60

多語言與長上下文效能

Qwen1.5-32B 支援 12 種語言,包括阿拉伯語、西班牙語、法語、葡萄牙語、德語、義大利語、俄語、日語、韓語、越南語、泰語與印尼語。其在考試、理解、數學與翻譯等方面的平均表現為 56.91,高於 Mixtral-8x7B(50.39),略低於 Qwen1.5-72B(60.44)。

此外,該模型在「大海撈針」評估中,對長度最高達 32K 令牌的上下文亦能達到頂級表現。

Sources