Qwen2.5 发布说明:新基础模型、Coder 与 Math 模型
Qwen 宣布发布 Qwen2.5,这是一项大型开源更新,包含多样化的通用语言模型、面向编码的专用模型(Qwen2.5-Coder)和面向数学的专用模型(Qwen2.5-Math),以及增强版的 Qwen2-VL-72B 视觉语言模型。
Qwen2.5 通用语言模型
Qwen2.5 引入了一系列密集的仅解码器模型,规模分别为 0.5B、1.5B、3B、7B、14B、32B 和 72B。这些模型在规模高达 18 万亿 token 的大规模数据集上进行预训练,带来了显著的知识提升和相较于 Qwen2 的能力改进。
关键技术能力
- 知识与推理: 模型在通用知识(MMLU:85+)、编码(HumanEval 85+)和数学(MATH 80+)方面表现出提升。
- 上下文与生成: Qwen2.5 支持最高 128K token 的上下文窗口,并可生成最多 8K token。
- 结构化数据: 在理解结构化数据(如表格)和生成结构化输出,尤其是 JSON 格式方面有显著提升。
- 指令遵循: 模型对多样化系统提示更具韧性,提升了在角色扮演和聊天机器人条件设定中的实用性。
- 多语言支持: 模型支持超过 29 种语言,包括英语、中文、法语、西班牙语、葡萄牙语、德语、意大利语、俄语、日语、韩语、越南语、泰语和阿拉伯语。
性能基准
- Qwen2.5-72B: 这款旗舰开源模型可与 Llama-3.1-70B 和 Mistral-Large-V2 竞争。据报道,Qwen2.5-72B 的基础模型在面对更大模型如 Llama-3-405B 时仍能达到顶级性能。
- 中等规模模型(14B 与 32B): Qwen2.5-14B 与 Qwen2.5-32B 重新推出,以在规模与能力之间取得平衡,性能超越 Phi-3.5-MoE-Instruct 与 Gemma2-27B-IT 等基线模型。
- 小型语言模型(SLM): Qwen2.5-3B 展示出高知识密度,尽管参数量小,但仍取得竞争性结果(MMLU 分数超过 65)。
- 基于 API 的模型: Qwen-Plus 与 Llama-3.1-405B 竞争,并显著超越 DeepSeek-V2.5,尽管在某些方面仍落后于 GPT-4o 与 Claude-3.5-Sonnet。Qwen-Turbo 提供了成本效益高、响应快速的服务。
专业化专家模型
Qwen 发布了两类专门的模型系列,旨在高性能技术任务。
Qwen2.5-Coder
Qwen2.5-Coder 旨在调试、代码建议以及回答编程问题,使用 5.5 万亿 token 的代码相关数据进行训练。提供 1.5B、7B 以及即将推出的 32B 规模。7B-Instruct 版本在多种编程语言上表现优于许多更大的语言模型。
Qwen2.5-Math
Qwen2.5-Math 提供 1.5B、7B 与 72B 规模,预训练使用更大规模的数学相关数据,包括由 Qwen2-Math 生成的合成数据。支持中英文,并采用以下推理方法:
- 思维链(Chain-of-Thought,CoT)
- 思维程序(Program-of-Thought,PoT)
- 工具集成推理(Tool-Integrated Reasoning,TIR)
据报道,Qwen2.5-Math-72B-Instruct 在整体性能上超越 Qwen2-Math-72B-Instruct 与 GPT-4o。
部署与工具集成
Qwen2.5 模型兼容主流行业框架,可用于部署和推理:
- Hugging Face: 通过 Transformers 库提供支持。
- vLLM: 支持兼容 OpenAI API 的服务和内置工具调用(需要 vLLM >= 0.6),使用受 Nous Hermes 启发的模板。
- Ollama: 通过其兼容 OpenAI 的服务支持工具调用。
- 工具调用模板: 聊天模板为 Hugging Face transformers 提供工具调用支持,同时保持对 Qwen2 模板和 Qwen-Agent 的向后兼容性。
许可与可用性
除 3B 与 72B 变体外,Qwen2.5 发布的所有开源模型均采用 Apache 2.0 许可证。