Qwen1.5 發行說明 / 新功能

Qwen 已發布 Qwen1.5,這是一系列開源的基礎模型與聊天模型,涵蓋多種規模以及 MoE 版本,旨在提升人類偏好對齊、多語言效能以及整體開發者體驗。此發布具有重要意義,因為它將模型直接整合至 Hugging Face transformers 函式庫,免除自訂遠端程式碼的需求,並擴大與主要部署與微調框架的相容性。

模型可用性與生態系統整合

Qwen1.5 提供基礎模型與聊天模型共八種規模:0.5B、1.8B、4B、7B、14B、32B、72B 與 110B,另有混合專家(Mixture-of-Experts,MoE)模型。為支援多樣的部署環境,實驗室提供量化版本,包括 Int4 與 Int8 GPTQ、AWQ 以及 GGUF 格式。

開發者體驗改進

Qwen1.5 的主要技術變化是將其程式碼合併至 Hugging Face transformers(版本 4.37.0 以上)。這使開發者能在不設定 trust_remote_code=True 的情況下載入模型。

Qwen1.5 亦原生支援以下生態系統:

  • 部署: vLLM (>=0.3.0) 與 SGLang (>=0.1.11)。
  • 量化: AutoAWQ 與 AutoGPTQ。
  • 微調: Axolotl 與 LLaMA-Factory。
  • 本地推論: llama.cpp、Ollama 與 LMStudio。
  • API 服務: DashScope 與 together.ai。

技術能力與效能

所有 Qwen1.5 模型皆統一支援最高 32,768 個 token 的上下文長度。此系列在語言理解、程式碼、推理與數學方面展現出強勁效能。

基礎基準測試

Qwen1.5-72B 在所有評估的基準測試中均優於 Llama2-70B,涵蓋 MMLU、C-Eval、GSM8K、MATH、HumanEval、MBPP 與 BBH。對於小規模模型(參數低於 7B),Qwen1.5-0.5B、1.8B 與 4B 被定位為相當具競爭力的社群小型語言模型(SLM)替代方案。

人類偏好對齊

Qwen1.5 聊天模型使用直接策略優化(Direct Policy Optimization,DPO)與近端策略優化(Proximal Policy Optimization,PPO)進行對齊。根據 MT-Bench 與 AlpacaEval 2.0 的結果,Qwen1.5-72B-Chat 超越 Claude-2.1、GPT-3.5-Turbo-0613、Mixtral-8x7b-instruct 與 TULU 2 DPO 70B,表現與 Mistral Medium 相當。

多語言熟練度

基礎模型在來自歐洲、東亞與東南亞的 12 種語言上進行評估。效能以四個面向測量:考試、理解、翻譯與數學。Qwen1.5-72B 在包括阿拉伯語、西班牙語、法語、日語、韓語與泰語等語言上展現出強大的能力。

長上下文效能

在 L-Eval 基準測試中,Qwen1.5-72B-Chat 明顯優於 GPT3.5-turbo-16k,且緊追 GPT4-32k。即使是較小的 Qwen1.5-7B-Chat,在五項 L-Eval 任務中有四項亦能與 GPT-3.5 競爭。

外部系統整合與代理能力

Qwen1.5-Chat 模型設計可透過檢索增強生成(Retrieval-Augmented Generation,RAG)與函式呼叫,整合外部知識以支援 AI 代理工作流程。

RAG 與工具使用

  • RAG: 在 RGB 基準測試中,Qwen1.5-72B-Chat 在英語與中文皆展現強勁表現,尤其在拒絕與整合任務上。
  • 工具選擇: 在工具使用基準測試中,Qwen1.5-72B-Chat 的工具選擇與輸入準確度接近 GPT-4 的表現。
  • 代理效能: 在 T-Eval 基準測試中,Qwen1.5-72B-Chat 在英語與中文取得高分,特別是在規劃與檢索方面。

程式碼解譯器

雖然 Qwen1.5-72B-Chat 在一般程式碼解譯任務中表現良好(正確率 87.9%),但在專業數學問題解決與視覺化任務上仍落後於 GPT-4。Qwen 團隊已將在預訓練與對齊階段提升程式碼能力列為未來版本的優先事項。

Sources