Qwen2.5-Max 发布说明

Qwen 宣布发布 Qwen2.5-Max,这是一个通过海量数据和模型规模来提升智能的大规模 Mixture-of-Experts (MoE) 模型。该模型现在可通过 Qwen Chat 界面以及阿里巴巴云提供的 OpenAI 兼容 API 使用。

模型架构与训练

Qwen2.5-Max 基于 Mixture-of-Experts (MoE) 架构构建。它在超过 20 万亿个 token 的数据集上进行了预训练。为了提升其能力,该模型经过了使用精心策划的监督微调(SFT)和人类反馈强化学习(RLHF)方法的后训练。

性能基准

Qwen2.5-Max 在几个关键基准上展示了与专有和开放权重模型相当的性能:

指令模型性能

与包括 GPT-4o、Claude-3.5-Sonnet 和 DeepSeek V3 在内的最先进模型相比,Qwen2.5-Max 指令模型在以下方面优于 DeepSeek V3:

  • Arena-Hard
  • LiveBench
  • LiveCodeBench
  • GPQA-Diamond

它在 MMLU-Pro 上也表现出相当的结果,该基测试大学水平的知识。

基础模型性能

在基础模型的评估中,Qwen2.5-Max 与 Llama-3.1-405B、Qwen2.5-72B 和 DeepSeek V3 进行了比较。Qwen 团队报告称,Qwen2.5-Max 基础模型在这些基准中的大多数上表现出显著优势。

可用性与集成

Qwen2.5-Max(模型名称 qwen-max-2025-01-25)可通过两个主要渠道获取:

  1. Qwen Chat:用户可以直接与模型交互,利用诸如工件和搜索等功能。
  2. Alibaba Cloud API:该 API 与 OpenAI 兼容,开发者可以通过将 base_url 指向 https://dashscope-intl.aliyuncs.com/compatible-mode/v1,使用标准的 OpenAI Python 库来集成该模型。

未来研究方向

Qwen 正专注于应用规模化强化学习,以进一步提升大型语言模型的思考和推理能力,目标是使模型能够超越人类水平的智能。

Sources