QwQ-32B 版本說明 / 新功能

Qwen 已推出 QwQ-32B,這是一個 320 億參數的模型,利用縮放強化學習(RL)來達到與 6710 億參數的 DeepSeek-R1 相媲美的推理能力。此版本展示了將 RL 應用於擁有廣泛世界知識的穩健基礎模型上,可顯著提升智能與推理效率。

縮放強化學習以提升推理

QwQ-32B 使用多階段強化學習方法,以超越傳統預訓練和後訓練的方式來提升推理能力。

第一階段:領域特定的 RL

在初始階段,RL 被專門縮放用於數學和編碼任務。為了在不依賴傳統獎勵模型的情況下確保準確性,Qwen 透過以下方式實施了基於結果的獎勵:

  • 準確性驗證器: 用於數學問題,以驗證最終解答的正確性。
  • 代碼執行伺服器: 用於評估生成的代碼是否成功通過預定義的測試案例。

第二階段:通用能力的 RL

在領域特定階段之後,第二階段的 RL 專注於通用能力。此階段利用來自通用獎勵模型和基於規則的驗證器的獎勵。這個簡短的訓練階段能提升指令遵循、人類偏好對齊以及代理表現,而不會顯著降低數學或編碼能力。

模型能力與性能

QwQ-32B 專為複雜問題解決、數學推理和編碼而設計。它整合了與代理相關的能力,使模型在使用工具時能夠進行批判性思考,並根據來自環境的回饋調整其推理。

性能評估顯示 QwQ-32B 與以下領先模型具有競爭力:

  • DeepSeek-R1
  • o1-mini
  • DeepSeek-R1-Distilled-Llama-70B
  • DeepSeek-R1-Distilled-Qwen-32B

部署與可存取性

QwQ-32B 是一個在 Apache 2.0 授權下發布的開放權重模型。它可透過以下管道取得:

  • Hugging Face 和 ModelScope: 透過 Transformers 進行本地部署的開放權重存取。
  • Qwen Chat: 可透過網頁介面存取。
  • Alibaba Cloud DashScope API: 可用於程式化整合。

未來研究方向

Qwen 計畫進一步探索基礎模型與縮放強化學習的交叉點,以邁向人工通用智能(AGI)。未來重點關注的領域包括:

  • 推理時間縮放: 透過在推理過程中縮放計算來解鎖更高的智能。
  • 長時程推理: 將代理與 RL 整合,以使模型能夠處理較長時間內的複雜多步驟推理任務。

Sources