QwQ-32B 版本說明 / 新功能
Qwen 已推出 QwQ-32B,這是一個 320 億參數的模型,利用縮放強化學習(RL)來達到與 6710 億參數的 DeepSeek-R1 相媲美的推理能力。此版本展示了將 RL 應用於擁有廣泛世界知識的穩健基礎模型上,可顯著提升智能與推理效率。
縮放強化學習以提升推理
QwQ-32B 使用多階段強化學習方法,以超越傳統預訓練和後訓練的方式來提升推理能力。
第一階段:領域特定的 RL
在初始階段,RL 被專門縮放用於數學和編碼任務。為了在不依賴傳統獎勵模型的情況下確保準確性,Qwen 透過以下方式實施了基於結果的獎勵:
- 準確性驗證器: 用於數學問題,以驗證最終解答的正確性。
- 代碼執行伺服器: 用於評估生成的代碼是否成功通過預定義的測試案例。
第二階段:通用能力的 RL
在領域特定階段之後,第二階段的 RL 專注於通用能力。此階段利用來自通用獎勵模型和基於規則的驗證器的獎勵。這個簡短的訓練階段能提升指令遵循、人類偏好對齊以及代理表現,而不會顯著降低數學或編碼能力。
模型能力與性能
QwQ-32B 專為複雜問題解決、數學推理和編碼而設計。它整合了與代理相關的能力,使模型在使用工具時能夠進行批判性思考,並根據來自環境的回饋調整其推理。
性能評估顯示 QwQ-32B 與以下領先模型具有競爭力:
- DeepSeek-R1
- o1-mini
- DeepSeek-R1-Distilled-Llama-70B
- DeepSeek-R1-Distilled-Qwen-32B
部署與可存取性
QwQ-32B 是一個在 Apache 2.0 授權下發布的開放權重模型。它可透過以下管道取得:
- Hugging Face 和 ModelScope: 透過 Transformers 進行本地部署的開放權重存取。
- Qwen Chat: 可透過網頁介面存取。
- Alibaba Cloud DashScope API: 可用於程式化整合。
未來研究方向
Qwen 計畫進一步探索基礎模型與縮放強化學習的交叉點,以邁向人工通用智能(AGI)。未來重點關注的領域包括:
- 推理時間縮放: 透過在推理過程中縮放計算來解鎖更高的智能。
- 長時程推理: 將代理與 RL 整合,以使模型能夠處理較長時間內的複雜多步驟推理任務。