Qwen1.5 发布说明 / 新功能

Qwen 已发布 Qwen1.5,这是一系列跨多种规模的开源基础模型和聊天模型,以及一个 MoE 版本,旨在提升对人类偏好的对齐、多语言性能以及整体开发者体验。此发布的重要之处在于它将模型直接集成到 Hugging Face transformers 库中,省去了自定义远程代码的需求,并扩大了与主要部署和微调框架的兼容性。

模型可用性与生态系统集成

Qwen1.5 提供八种规模的基础模型和聊天模型:0.5B、1.8B、4B、7B、14B、32B、72B 和 110B,以及一个 Mixture-of-Experts (MoE) 模型。为支持多样的部署环境,实验室提供了包括 Int4 和 Int8 GPTQ、AWQ、GGUF 格式在内的量化版本。

开发者体验改进

Qwen1.5 的主要技术转变是将其代码合并到 Hugging Face transformers(版本 4.37.0 及以上)。这使得开发者无需设置 trust_remote_code=True 即可加载模型。

Qwen1.5 也原生支持以下生态系统:

  • 部署: vLLM (>=0.3.0) 和 SGLang (>=0.1.11)。
  • 量化: AutoAWQ 和 AutoGPTQ。
  • 微调: Axolotl 和 LLaMA-Factory。
  • 本地推理: llama.cpp、Ollama 和 LMStudio。
  • API 服务: DashScope 和 together.ai。

技术能力与性能

所有 Qwen1.5 模型统一支持最高 32,768 token 的上下文长度。该系列在语言理解、代码、推理和数学方面表现出强劲的性能。

基础基准测试

Qwen1.5-72B 在所有评估基准上均优于 Llama2-70B,包括 MMLU、C-Eval、GSM8K、MATH、HumanEval、MBPP 和 BBH。对于小规模模型(参数低于 7B),Qwen1.5-0.5B、1.8B 和 4B 被定位为对其他社区小语言模型(SLMs)的高度竞争替代方案。

人类偏好对齐

Qwen1.5 聊天模型使用 Direct Policy Optimization (DPO) 和 Proximal Policy Optimization (PPO) 进行对齐。根据 MT-Bench 和 AlpacaEval 2.0 的结果,Qwen1.5-72B-Chat 超越了 Claude-2.1、GPT-3.5-Turbo-0613、Mixtral-8x7b-instruct 和 TULU 2 DPO 70B,表现与 Mistral Medium 相当。

多语言能力

基础模型在来自欧洲、东亚和东南亚的 12 种语言上进行评估。性能在四个维度上进行衡量:考试、理解、翻译和数学。Qwen1.5-72B 在包括阿拉伯语、西班牙语、法语、日语、韩语和泰语等语言上展现出强大的能力。

长上下文性能

在 L-Eval 基准上评估,Qwen1.5-72B-Chat 显著超越 GPT3.5-turbo-16k,并紧随 GPT4-32k。即使是较小的 Qwen1.5-7B-Chat 在五个 L-Eval 任务中也有四项能够与 GPT-3.5 竞争。

外部系统集成与代理能力

Qwen1.5-Chat 模型旨在通过检索增强生成(RAG)和函数调用与外部知识集成,以支持 AI 代理工作流。

RAG 与工具使用

  • RAG: 在 RGB 基准上,Qwen1.5-72B-Chat 在英文和中文方面均表现出强劲的性能,尤其在拒绝和集成任务上。
  • 工具选择: 在工具使用基准中,Qwen1.5-72B-Chat 在工具选择和输入准确性方面接近 GPT-4 的表现。
  • 代理性能: 在 T-Eval 基准上,Qwen1.5-72B-Chat 在英文和中文方面取得高分,尤其在规划和检索方面。

代码解释器

虽然 Qwen1.5-72B-Chat 在通用代码解释任务中表现良好(准确率 87.9%),但在专门的数学问题求解和可视化任务上落后于 GPT-4。Qwen 团队已将提升预训练和对齐期间的编码能力列为未来版本的重点。

Sources