QwQ-32B 发布说明 / 新功能

Qwen 推出了 QwQ-32B,这是一个 320亿参数的模型,利用扩展的强化学习(RL)来实现与 6710亿参数的 DeepSeek-R1 相当的推理能力。此次发布表明,将 RL 应用于具有广泛世界知识的稳健基础模型可以显著提升智能和推理效率。

扩展强化学习以提升推理

QwQ-32B 采用多阶段强化学习方法,以超越传统预训练和后训练的方式扩展推理能力。

第一阶段:领域特定的 RL

在初始阶段,RL 被专门用于数学和编码任务进行扩展。为了在不依赖传统奖励模型的情况下确保准确性,Qwen 采用了基于结果的奖励,使用:

  • Accuracy Verifiers: 用于数学问题,以验证最终解决方案的正确性。
  • Code Execution Servers: 用于评估生成的代码是否成功通过预定义的测试用例。

第二阶段:通用能力 RL

在领域特定阶段之后,第二阶段的 RL 专注于通用能力。此阶段利用通用奖励模型和基于规则的验证器的奖励。此简短的训练阶段在不导致数学或编码熟练度显著下降的情况下,提升指令遵循、人类偏好对齐和代理性能。

模型能力与性能

QwQ-32B 专为复杂问题解决、数学推理和编码而设计。它集成了与代理相关的能力,使模型在使用工具时能够进行批判性思考,并根据环境反馈调整其推理。

性能评估表明,QwQ-32B 与以下领先模型具有竞争力:

  • DeepSeek-R1
  • o1-mini
  • DeepSeek-R1-Distilled-Llama-70B
  • DeepSeek-R1-Distilled-Qwen-32B

部署与可访问性

QwQ-32B 是一个在 Apache 2.0 许可证下发布的开放权重模型。它可通过以下渠道获取:

  • Hugging Face 和 ModelScope: 通过 Transformers 进行本地部署的开放权重访问。
  • Qwen Chat: 可通过网页界面访问。
  • Alibaba Cloud DashScope API: 可用于编程集成。

未来研究方向

Qwen 打算进一步探索基础模型与扩展强化学习的交叉点,以迈向通用人工智能(AGI)。未来重点关注的领域包括:

  • 推理时间扩展: 通过在推理过程中扩展计算来解锁更高的智能。
  • 长期推理: 将代理与 RL 集成,使模型能够处理更长时间范围内的复杂多步推理任务。

Sources