Qwen2.5 版本說明:全新基礎模型、Coder 與 Math 模型
Qwen 宣布發布 Qwen2.5,這是一項大型開源更新,包含多樣化的通用語言模型、針對程式設計的專門模型(Qwen2.5-Coder)與數學的專門模型(Qwen2.5-Math),以及升級版的 Qwen2-VL-72B 視覺語言模型。
Qwen2.5 通用語言模型
Qwen2.5 引入了一系列密集的僅解碼器模型,規模分別為 0.5B、1.5B、3B、7B、14B、32B 與 72B。這些模型在規模高達 18 兆 token 的大型資料集上進行預訓練,帶來顯著的知識提升與相較於 Qwen2 的能力增強。
主要技術能力
- 知識與推理: 模型在通用知識(MMLU:85 以上)、程式設計(HumanEval 85 以上)與數學(MATH 80 以上)方面展現出提升的表現。
- 上下文與生成: Qwen2.5 支援最高 128K token 的上下文窗口,且可生成至多 8K token。
- 結構化資料: 在理解結構化資料(如表格)以及產生結構化輸出,特別是 JSON 格式方面有顯著提升。
- 指令遵循: 模型對多樣化系統提示的韌性更高,提升了在角色扮演與聊天機器人條件設定等情境中的實用性。
- 多語言支援: 模型支援超過 29 種語言,包括英語、中文、法語、西班牙語、葡萄牙語、德語、義大利語、俄語、日語、韓語、越南語、泰語與阿拉伯語。
效能基準
- Qwen2.5-72B: 這款旗艦開源模型可與 Llama-3.1-70B 與 Mistral-Large-V2 競爭。據報導,Qwen2.5-72B 的基礎模型即使面對更大型的模型如 Llama-3-405B,也能達到頂尖效能。
- 中型模型(14B 與 32B): Qwen2.5-14B 與 Qwen2.5-32B 重新推出,以在規模與能力之間取得平衡,表現優於 Phi-3.5-MoE-Instruct 與 Gemma2-27B-IT 等基線模型。
- 小型語言模型(SLM): Qwen2.5-3B 展示出高知識密度,儘管參數量較小,仍能取得具競爭力的結果(MMLU 分數超過 65)。
- API 版模型: Qwen-Plus 可與 Llama-3.1-405B 競爭,且明顯優於 DeepSeek-V2.5,雖然在某些領域仍落後於 GPT-4o 與 Claude-3.5-Sonnet。Qwen-Turbo 提供具成本效益且快速的服務。
專業專家模型
Qwen 已發布兩個專門的模型系列,旨在高效執行技術任務。
Qwen2.5-Coder
Qwen2.5-Coder 針對除錯、程式碼建議與回答程式設計問題而設計,訓練時使用了 5.5 兆 token 的程式碼相關資料。提供 1.5B、7B 與即將推出的 32B 規模。7B-Instruct 版本在多種程式語言上被指出能超越許多更大型的語言模型。
Qwen2.5-Math
Qwen2.5-Math 提供 1.5B、7B 與 72B 規模,預訓練時使用更大規模的數學相關資料,包括由 Qwen2-Math 產生的合成資料。支援中文與英文,並採用以下推理方法:
- 思考鏈(Chain-of-Thought,CoT)
- 程式思考(Program-of-Thought,PoT)
- 工具整合推理(Tool-Integrated Reasoning,TIR)
據報導,Qwen2.5-Math-72B-Instruct 模型在整體效能上超越 Qwen2-Math-72B-Instruct 與 GPT-4o。
部署與工具整合
Qwen2.5 模型相容於主要產業框架,可用於部署與推論:
- Hugging Face: 透過 Transformers 函式庫支援。
- vLLM: 支援相容 OpenAI API 的服務與內建工具呼叫(需 vLLM >= 0.6),使用受 Nous Hermes 啟發的模板。
- Ollama: 透過其相容 OpenAI 的服務支援工具呼叫。
- 工具呼叫模板: 聊天模板包含對 Hugging Face transformers 的工具呼叫支援,同時保持與 Qwen2 模板與 Qwen-Agent 的向後相容性。
授權與可用性
除 3B 與 72B 變體外,Qwen2.5 釋出的所有開源模型皆採用 Apache 2.0 授權。