Qwen1.5-110B 发布说明 / 新功能

Qwen 已发布 Qwen1.5-110B,这是 Qwen1.5 系列中首个参数量超过 1000 亿的模型。此版本表明,增大模型规模仍能在基础能力和对话交互上带来性能提升,使其成为 Llama-3-70B 等其他大规模开源模型的有竞争力的替代方案。

模型架构与技术规格

Qwen1.5-110B 使用与 Qwen1.5 系列其他模型相似的 Transformer 解码器架构。关键技术规格包括:

  • Grouped Query Attention (GQA): 模型采用 GQA,以确保模型服务时的效率。
  • 上下文窗口: 支持 32K token 的上下文长度。
  • 多语言支持: 模型保持多语言能力,支持包括英语、中文、法语、西班牙语、德语、俄语、韩语、日语、越南语和阿拉伯语在内的多种语言。

基础模型性能

Qwen1.5-110B 在多个基准测试上与 Meta-Llama3-70B 和 Mixtral-8x22B 竞争。Qwen 团队指出,通过增大模型规模而不大幅改变预训练和后训练配方,即实现了相较 Qwen1.5-72B 的性能提升。

基准测试 Qwen1.5-110B Qwen1.5-72B Llama-3-70B Mixtral-8x22B
MMLU 80.4 77.5 79.5 77.8
TheoremQA 34.9 29.3 32.0 35.9
GPQA 35.9 36.3 36.4 34.3
Hellaswag 87.5 86.0 88.0 88.7
BBH 74.8 65.5 76.6 69.2
ARC-C 69.6 65.9 68.8 70.7
GSM8K 85.4 79.5 79.2 78.6
MATH 49.6 34.1 41.0 41.7
HumanEval 52.4 41.5 45.7 45.1
MBPP 58.1 53.4 55.1 71.2

聊天模型评估

在针对聊天的评估中,Qwen1.5-110B-Chat 相较 Qwen1.5-72B-Chat 有显著提升,并在 MT-Bench 与 AlpacaEval 2.0 两项指标上均超越 Llama-3-70B-Instruct。

模型 MT-Bench(平均分) AlpacaEval 2.0(LC 胜率)
Llama-3-70B-Instruct 8.85 34.40
Qwen1.5-72B-Chat 8.61 36.60
Qwen1.5-110B-Chat 8.88 43.90

模型扩展的意义

Qwen1.5-110B 的发布表明,通过模型规模的扩大仍有显著的性能提升空间。虽然 Qwen 团队认可 Llama-3 所展示的数据规模重要性,但他们计划在未来的发布(包括即将到来的 Qwen2)中同时扩大数据和模型规模,以继续提升性能。

Sources