Qwen2.5-Max 发布说明
Qwen 宣布发布 Qwen2.5-Max,这是一个通过海量数据和模型规模来提升智能的大规模 Mixture-of-Experts (MoE) 模型。该模型现在可通过 Qwen Chat 界面以及阿里巴巴云提供的 OpenAI 兼容 API 使用。
模型架构与训练
Qwen2.5-Max 基于 Mixture-of-Experts (MoE) 架构构建。它在超过 20 万亿个 token 的数据集上进行了预训练。为了提升其能力,该模型经过了使用精心策划的监督微调(SFT)和人类反馈强化学习(RLHF)方法的后训练。
性能基准
Qwen2.5-Max 在几个关键基准上展示了与专有和开放权重模型相当的性能:
指令模型性能
与包括 GPT-4o、Claude-3.5-Sonnet 和 DeepSeek V3 在内的最先进模型相比,Qwen2.5-Max 指令模型在以下方面优于 DeepSeek V3:
- Arena-Hard
- LiveBench
- LiveCodeBench
- GPQA-Diamond
它在 MMLU-Pro 上也表现出相当的结果,该基测试大学水平的知识。
基础模型性能
在基础模型的评估中,Qwen2.5-Max 与 Llama-3.1-405B、Qwen2.5-72B 和 DeepSeek V3 进行了比较。Qwen 团队报告称,Qwen2.5-Max 基础模型在这些基准中的大多数上表现出显著优势。
可用性与集成
Qwen2.5-Max(模型名称 qwen-max-2025-01-25)可通过两个主要渠道获取:
- Qwen Chat:用户可以直接与模型交互,利用诸如工件和搜索等功能。
- Alibaba Cloud API:该 API 与 OpenAI 兼容,开发者可以通过将
base_url指向https://dashscope-intl.aliyuncs.com/compatible-mode/v1,使用标准的 OpenAI Python 库来集成该模型。
未来研究方向
Qwen 正专注于应用规模化强化学习,以进一步提升大型语言模型的思考和推理能力,目标是使模型能够超越人类水平的智能。