Qwen3-Coder-Next 釋出:高效能代理式編碼模型

Qwen3-Coder-Next 是一個為程式碼代理與本地開發優化的開放權重語言模型。透過擴大代理式訓練訊號而非僅僅增大參數規模,該模型在軟體工程基準測試上達到高階表現,同時保持顯著較低的推論成本。

架構與訓練方法論

Qwen3-Coder-Next 基於 Qwen3-Next-80B-A3B-Base 模型構建,採用結合混合注意力與專家混合(Mixture-of-Experts,MoE)的新穎架構。模型具備小型的活躍參數規模(3B 活躍參數),使其在不犧牲推理能力的前提下,能高效部署。

為了發展其代理式能力,Qwen 團隊專注於透過可驗證的程式碼任務與可執行環境擴大訓練訊號。訓練流程包含四個主要階段:

  1. 持續預訓練:聚焦於程式碼與代理為中心的資料。
  2. 監督式微調(SFT):使用高品質的代理軌跡教導模型如何處理複雜任務。
  3. 領域專精專家訓練:針對軟體工程、品質保證(QA)以及網頁/使用者體驗開發等特定領域。
  4. 專家蒸餾:將專業知識匯聚成單一、可部署的模型。

此方法優先考慮長程推理、工具使用以及從執行失敗中恢復的能力,這些對於自主程式碼代理至關重要。

效能基準測試

Qwen3-Coder-Next 在以代理為中心的評估中展現出強大的能力,尤其是在需要延伸推理的多回合任務上。

軟體工程基準測試

  • SWE-Bench Verified:在使用 SWE-Agent 框架時,模型的成功率超過 70%。
  • SWE-Bench Pro:在此更具挑戰性的基準測試中,模型仍具競爭力,隨著代理回合數的增加,效能持續提升,顯示出強大的長程推理能力。
  • 多語言支援:模型在各種多語言程式碼環境中保持競爭力的表現。

效率與參數權衡

Qwen3-Coder-Next 為具成本效益的代理部署樹立了新的 Pareto 前緣。僅有 3B 活躍參數,即可提供與擁有 10–20 倍更多活躍參數的開源模型相當的 SWE-Bench Pro 效能。

實際應用與整合

模型的高速與小體積使其適合整合至各種下游代理框架與應用,包括:

  • IDE 與代理框架:可與 Cline、Claude Code 與 OpenClaw 等工具整合。
  • 網頁開發:具備建立聊天介面、互動遊戲與 ASCII 藝術繪圖工具的能力。
  • CLI 與瀏覽器自動化:能執行桌面清理、實作網頁遊戲,並操作基於瀏覽器的代理執行如在 Amazon 搜尋商品或網站測試等任務。
  • 自訂示範:支援構建五子棋遊戲與其他 Qwen 模型(如 Qwen3-TTS)的 Gradio 示範。

未來發展

Qwen 團隊將進一步提升自主工具使用、處理高度複雜問題以及管理錯綜任務作為未來版本的主要目標。未來的工作將著重於增強推理與決策能力,並根據真實使用者互動資料更新模型。

Sources