Qwen1.5-110B 发布说明 / 新功能
Qwen 已发布 Qwen1.5-110B,这是 Qwen1.5 系列中首个参数量超过 1000 亿的模型。此版本表明,增大模型规模仍能在基础能力和对话交互上带来性能提升,使其成为 Llama-3-70B 等其他大规模开源模型的有竞争力的替代方案。
模型架构与技术规格
Qwen1.5-110B 使用与 Qwen1.5 系列其他模型相似的 Transformer 解码器架构。关键技术规格包括:
- Grouped Query Attention (GQA): 模型采用 GQA,以确保模型服务时的效率。
- 上下文窗口: 支持 32K token 的上下文长度。
- 多语言支持: 模型保持多语言能力,支持包括英语、中文、法语、西班牙语、德语、俄语、韩语、日语、越南语和阿拉伯语在内的多种语言。
基础模型性能
Qwen1.5-110B 在多个基准测试上与 Meta-Llama3-70B 和 Mixtral-8x22B 竞争。Qwen 团队指出,通过增大模型规模而不大幅改变预训练和后训练配方,即实现了相较 Qwen1.5-72B 的性能提升。
| 基准测试 | Qwen1.5-110B | Qwen1.5-72B | Llama-3-70B | Mixtral-8x22B |
|---|---|---|---|---|
| MMLU | 80.4 | 77.5 | 79.5 | 77.8 |
| TheoremQA | 34.9 | 29.3 | 32.0 | 35.9 |
| GPQA | 35.9 | 36.3 | 36.4 | 34.3 |
| Hellaswag | 87.5 | 86.0 | 88.0 | 88.7 |
| BBH | 74.8 | 65.5 | 76.6 | 69.2 |
| ARC-C | 69.6 | 65.9 | 68.8 | 70.7 |
| GSM8K | 85.4 | 79.5 | 79.2 | 78.6 |
| MATH | 49.6 | 34.1 | 41.0 | 41.7 |
| HumanEval | 52.4 | 41.5 | 45.7 | 45.1 |
| MBPP | 58.1 | 53.4 | 55.1 | 71.2 |
聊天模型评估
在针对聊天的评估中,Qwen1.5-110B-Chat 相较 Qwen1.5-72B-Chat 有显著提升,并在 MT-Bench 与 AlpacaEval 2.0 两项指标上均超越 Llama-3-70B-Instruct。
| 模型 | MT-Bench(平均分) | AlpacaEval 2.0(LC 胜率) |
|---|---|---|
| Llama-3-70B-Instruct | 8.85 | 34.40 |
| Qwen1.5-72B-Chat | 8.61 | 36.60 |
| Qwen1.5-110B-Chat | 8.88 | 43.90 |
模型扩展的意义
Qwen1.5-110B 的发布表明,通过模型规模的扩大仍有显著的性能提升空间。虽然 Qwen 团队认可 Llama-3 所展示的数据规模重要性,但他们计划在未来的发布(包括即将到来的 Qwen2)中同时扩大数据和模型规模,以继续提升性能。