QwQ-32B-Preview: 探索深度推理能力

Qwen 已發布 QwQ-32B-Preview,一個設計用來推動大型語言模型 (LLM) 推理邊界的實驗模型。該模型專注於「深度推理」,利用內部鏈式思考過程來解決通常會挑戰標準 LLM 的複雜數學、編程和邏輯問題。

深度推理與內部鏈式思考

QwQ-32B-Preview 經過設計,能在給出最終答案之前深入反思問題。與可能直接給出回答的標準模型不同,QwQ 使用一個可見的推理過程,在此過程中它會測試假設、發現自身邏輯中的錯誤,並迭代朝著正確解答前進。

此能力透過其對複雜謎題的處理方式得以展示。例如,當被要求在錯誤方程式 1 + 2 * 3 + 4 * 5 + 6 * 7 + 8 * 9 = 479 中加入一對括號以使其成立時,模型不會猜測。而是:

  • 建立基準: 計算無括號表達式的值(141)。
  • 迭代測試假設: 系統地嘗試不同的括號放置方式,並計算每次嘗試的結果。
  • 自我修正: 識別結果過低(例如 143、219)或過高(例如 837)時,並相應調整其策略。
  • 驗證解答: 找到正確的括號放置方式—1 + 2 * (3 + 4 * 5 + 6) * 7 + 8 * 9 = 479—後,它會再次檢查數學以確保準確性。

問題解決的技術方法

該模型的推理過程遵循結構化的邏輯流程,以導航「未知的邊界」。

系統探索

與其依賴模式匹配,QwQ-32B-Preview 採用試誤方法。在提供的例子中,該模型探索了多種分組策略,包括:

  • 個別項目的括號化。
  • 將加法分組在一起。
  • 將乘法分組以創建更大的中間值。

錯誤偵測與改進

該模型的一個關鍵特徵是其能夠意識到特定路徑無效。當模型遇到與目標值相差甚遠的結果時,它會明確指出差異(例如「現在這遠遠超過 479」),並轉向不同的分組邏輯。

對 AI 推理的影響

QwQ-32B-Preview 的發布凸顯了朝向能夠以使用者透明的方式逐步「思考」問題的模型的轉變。透過暴露模型的內部獨白,Qwen 為使用者提供了一種機制來驗證達到結論所使用的邏輯,從而減少技術領域中 AI 生成答案的「黑箱」特性。

Sources