介紹 Qwen:全面的 LLM 與 LMM 框架
Qwen 是一個旨在實現人工通用智慧 (AGI) 的專案,將大型語言模型 (LLMs) 與大型多模態模型 (LMMs) 結合於一體。生態系統包括基礎語言模型、針對聊天優化的版本 (Qwen-Chat)、針對程式碼 (Code-Qwen) 與數學 (Math-Qwen) 的領域專屬模型,以及針對視覺 (Qwen-VL) 與音訊 (Qwen-Audio) 的多模態擴充。
基礎模型架構與擴展
Qwen 是基於 Transformer 的語言模型,透過下一個 token 預測進行預訓練。開發重點在於同時擴大模型規模與資料量,以確保穩定性與效能。
模型變體與規格
以下四個已開源模型的規格如下:
| 模型 | 發布日期 | 最大長度 | 系統提示增強 | 預訓練 Token 數 | 最低 GPU 記憶體 (Q-Lora 微調) | 最低 GPU 使用量 (2048 Token Int4) | 工具使用 |
|---|---|---|---|---|---|---|---|
| Qwen-1.8B | 23.11.30 | 32K | ✓ | 2.2T | 5.8GB | 2.9GB | ✓ |
| Qwen-7B | 23.08.03 | 32K | ✐ | 2.4T | 11.5GB | 8.2GB | ✓ |
| Qwen-14B | 23.09.25 | 8K | ✐ | 3.0T | 18.7GB | 13.0GB | ✓ |
| Qwen-72B | 23.11.30 | 32K | ✓ | 2.2T | 61.4GB | 48.9GB | ✓ |
多語言能力與斷詞方式
Qwen 被設計為多語言模型,在英語與中文上展現強大能力,亦具備西班牙語、法語與日語的一定熟練度。這是透過高效能的斷詞器實現的,該斷詞器在多語言間提供高壓縮率,優化資訊編碼。
上下文長度與外推能力
大多數開源 Qwen 模型支援 32K token 的上下文長度。此目標透過持續的長上下文預訓練以及提升 Rotary Positional Embeddings (RoPE) 的基礎值而達成。使用 L‑Eval 與 “Needle in a Haystack” 測試的評估結果證實模型能處理長上下文視窗。
在基準比較中,Qwen-72B-Chat (32K) 的平均分數為 62.30,於多項指標上超過 ChatGPT-3.5-16k (60.73),包括 TOEFL (86.24 vs 78.43) 與 QuALITY (77.22 vs 61.38)。
對齊與後訓練
Qwen 採用兩階段對齊流程:監督式微調 (SFT) 與來自人類回饋的強化學習 (RLHF)。
監督式微調 (SFT)
對齊從 SFT 開始,團隊聚焦於資料的多樣性與複雜度,使用如 instag 與 tulu 2 等資料集。透過人工檢查與自動評估相結合,維持資料品質。
來自人類回饋的強化學習 (RLHF)
在 SFT 模型之上,Qwen 採用基於 PPO 的 RLHF。為解決訓練不穩定問題,團隊開發了在大規模比較資料上預訓練、再於高品質、精心標記的比較資料上微調的可靠獎勵模型。最終的 RLHF 模型相較僅使用 SFT 的模型,展現更高的創造力與更佳的指令遵循能力。
工具使用與代理能力
Qwen 被設計為可透過 ReAct 格式產生思考與行動的代理人。這使模型能在未見過的工具上透過上下文學習理解指令與示範,進而使用這些工具。
支援的框架
- Function Calling:直接執行特定函式。
- Code Interpreter:用於複雜資料分析。
- Hugging Face Agent:與各種 AI 模型整合,產生多樣化輸出,例如圖像生成。
AgentFabric
沿襲 GPTs 的概念,Qwen 推出 AgentFabric,一個允許使用者透過簡易聊天式設定流程建立專屬 AI 代理人的框架。
Sources
- OriginalIntroducing Qwen