Qwen1.5-110B 版本說明 / 新功能

模型架構與技術規格

Qwen1.5-110B 採用與 Qwen1.5 系列其他模型相似的 Transformer 解碼器架構。主要技術規格包括:

  • Grouped Query Attention (GQA): 模型加入 GQA 以確保模型服務時的效率。
  • Context Window(上下文窗口): 支援 32K 令牌的上下文長度。
  • Multilingual Support(多語言支援): 模型保有多語言能力,支援包括英語、中文、法語、西班牙語、德語、俄語、韓語、日語、越南語與阿拉伯語等多種語言。

基礎模型效能

Qwen1.5-110B 在多項基準測試中與 Meta-Llama3-70B 與 Mixtral-8x22B 具競爭力。Qwen 團隊指出,較 Qwen1.5-72B 模型的效能提升是透過擴大模型規模,而非大幅改變預訓練與後訓練流程而達成的。

基準測試 Qwen1.5-110B Qwen1.5-72B Llama-3-70B Mixtral-8x22B
MMLU 80.4 77.5 79.5 77.8
TheoremQA 34.9 29.3 32.0 35.9
GPQA 35.9 36.3 36.4 34.3
Hellaswag 87.5 86.0 88.0 88.7
BBH 74.8 65.5 76.6 69.2
ARC-C 69.6 65.9 68.8 70.7
GSM8K 85.4 79.5 79.2 78.6
MATH 49.6 34.1 41.0 41.7
HumanEval 52.4 41.5 45.7 45.1
MBPP 58.1 53.4 55.1 71.2

聊天模型評估

在聊天專屬評估中,Qwen1.5-110B-Chat 相較於 Qwen1.5-72B-Chat 模型顯著提升。它在 MT-Bench 與 AlpacaEval 2.0 兩項測試中均優於 Llama-3-70B-Instruct。

模型 MT-Bench(平均分數) AlpacaEval 2.0(LC 勝率)
Llama-3-70B-Instruct 8.85 34.40
Qwen1.5-72B-Chat 8.61 36.60
Qwen1.5-110B-Chat 8.88 43.90

模型擴展的意涵

Qwen1.5-110B 的發布顯示,透過模型規模擴大仍有相當大的效能提升空間。雖然 Qwen 團隊承認 Llama-3 所示的資料規模擴大的重要性,但他們計畫在未來的發布(包括即將推出的 Qwen2)中,同時擴大資料與模型規模以作為策略。

Sources