Mixtral 8x22B 发布说明
Mistral AI 宣布发布 Mixtral 8x22B,这是一款稀疏混合专家 (SMoE) 模型,旨在提供高性能和高成本效益。该模型在总共 141B 参数中仅使用 39B 激活参数,使其能够在保持高性价比的同时,比稠密 70B 模型运行得更快。
架构与效率
Mixtral 8x22B 被构建为稀疏混合专家模型,这意味着它在推理过程中仅激活其总参数量的一小部分。凭借 39B 激活参数和 141B 总参数,该模型专为成本效率和速度而设计。Mistral AI 表示,这种架构使该模型比任何稠密 70B 模型都更快,并且比其他在宽松和限制性许可下提供的开源权重模型更强大。
核心能力与技术规格
Mixtral 8x22B 提供了几项核心技术优势:
- 多语言能力: 该模型精通英语、法语、意大利语、德语和西班牙语。
- 上下文窗口: 它具有 64K token 上下文窗口,能够从大型文档中精确检索信息。
- 函数调用 (Function Calling): 该模型原生具备函数调用能力。当结合 la Plateforme 上的受限输出模式时,这可以支持大规模应用开发和技术栈现代化。
- 推理、数学与编程: 该模型针对推理进行了优化,并且与其他开源模型相比,在数学和编程任务中表现出强大的性能。
性能基准测试
Mixtral 8x22B 在多个行业基准测试中展示了卓越的性能:
推理与知识
该模型针对推理进行了优化,并在包括 MMLU (Measuring massive multitask language in understanding)、HellaSwag、Wino Grande、Arc Challenge、TriviaQA 和 NaturalQS 在内的基准测试中表现出领先的性能。
多语言性能
Mixtral 8x22B 在 HellaSwag、Arc Challenge 和 MMLU 基准测试中,特别是在法语、德语、西班牙语和意大利语方面,表现优于 LLaMA 2 70B。
数学与编程
与其他开源模型相比,Mixtral 8x22B 在编程和数学任务中表现最佳。该模型的指令微调版本在 GSM8K maj@8 上获得了 90.8% 的分数,在 Math maj@4 上获得了 44.6% 的分数。
许可与可用性
Mixtral 8x22B 根据 Apache 2.0 许可发布,这是最宽松的开源许可,允许不受限制的使用。基础模型的可用性也使其成为微调用例的理想基础模型。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch