Qwen3-Coder-Next 发布:高效能代理式编码模型

Qwen3-Coder-Next 是一款开源权重的语言模型,专为编码代理和本地开发进行优化。通过在训练信号上进行规模化,而非仅仅增大参数量,模型在软件工程基准测试中实现了高水平表现,同时保持显著更低的推理成本。

架构与训练方法论

Qwen3-Coder-Next 基于 Qwen3-Next-80B-A3B-Base 模型构建,采用一种结合混合注意力和 Mixture-of-Experts(MoE)的新颖架构。模型拥有小规模的活跃参数占用(3B 活跃参数),这使得在不牺牲推理能力的前提下实现高效部署。

为了发展其代理能力,Qwen 团队专注于通过可验证的编码任务和可执行环境来扩大训练信号。训练流水线包括四个主要阶段:

  1. 持续预训练:侧重于代码和代理相关的数据。
  2. 监督微调(SFT):使用高质量的代理轨迹教会模型如何处理复杂任务。
  3. 领域专门专家训练:针对软件工程、质量保证(QA)以及网页/UX 开发等特定领域。
  4. 专家蒸馏:将专门知识汇聚到单一、可部署的模型中。

这种方法优先考虑长时程推理、工具使用以及从执行失败中恢复的能力,这些都是自主编码代理的关键要素。

性能基准

Qwen3-Coder-Next 在以代理为中心的评估中表现出色,尤其是在需要扩展推理的多轮任务中。

软件工程基准

  • SWE-Bench Verified:使用 SWE-Agent 框架时,模型的成功率超过 70%。
  • SWE-Bench Pro:在更具挑战性的基准上仍保持竞争力,随着代理轮次数的增加,性能提升,表明其具备强大的长时程推理能力。
  • 多语言支持:模型在各种多语言编码环境中保持竞争力的表现。

效率与参数权衡

Qwen3-Coder-Next 为成本效益高的代理部署树立了新的帕累托前沿。仅凭 3B 活跃参数,即可提供与拥有 10–20 倍活跃参数的开源模型相当的 SWE-Bench Pro 性能。

实际应用与集成

模型的高速与小体积使其适用于多种下游代理框架和应用,包括:

  • IDE 与代理框架:可与 Cline、Claude Code、OpenClaw 等工具集成。
  • 网页开发:具备创建聊天界面、交互式游戏以及 ASCII 艺术绘图工具的能力。
  • CLI 与浏览器自动化:能够执行桌面清理、实现网页游戏,并在浏览器中运行代理完成如在 Amazon 上搜索商品或网站测试等任务。
  • 自定义演示:支持构建五子棋游戏以及为其他 Qwen 模型(如 Qwen3-TTS)制作 Gradio 演示。

未来发展

Qwen 团队将进一步提升自主工具使用、处理高度复杂问题以及管理复杂任务的能力作为下一代模型的主要目标。未来工作将聚焦于加强推理与决策能力,并基于真实用户交互数据对模型进行更新。

Sources