Mixtral 8x7B 发布说明
Mistral AI 已发布 Mixtral 8x7B,这是一个高质量的稀疏专家混合模型(SMoE),采用 Apache 2.0 许可证开放权重。该模型旨在优化性能与成本之间的权衡,在大多数标准基准测试中表现与 GPT-3.5 或 Llama 2 70B 相当甚至更优,同时显著降低推理延迟。
稀疏专家混合(SMoE)架构
Mixtral 8x7B 采用稀疏专家混合网络,使模型在不按比例增加每 token 计算成本的情况下提升总参数量。
技术实现
作为仅解码器模型,Mixtral 8x7B 使用一个前馈块,从八个不同的参数组中进行选择。在每一层的每个 token 上,路由器网络会选择两个“专家”来处理该 token,并将它们的输出相加组合。
参数效率
该架构在控制延迟的同时实现了较高的总参数量。Mixtral 8x7B 总共拥有 467 亿参数,但每 token 仅使用 129 亿参数。因此,该模型的输出生成速度和成本与一个 129 亿参数的模型相当。
性能与基准测试
与 Llama 2 系列和 GPT-3.5 基础模型相比,Mixtral 8x7B 展现出更优的效率和质量。
通用基准测试
Mixtral 在大多数标准基准测试中表现与 Llama 2 70B 或 GPT-3.5 相当甚至更优。与 Llama 2 70B 相比,Mixtral 的推理速度提升了 6 倍。
多语言能力
该模型精通五种语言:英语、法语、意大利语、德语和西班牙语。
专业能力
- 上下文窗口: 模型支持 32k token 的上下文。
- 代码生成: Mixtral 在生成代码方面表现出色。
- 偏见与幻觉: 在 BBQ 基准测试中,Mixtral 的偏见程度低于 Llama 2。在 BOLD 基准测试中,其情感倾向比 Llama 2 更积极,且各维度的方差相似。
Mixtral 8x7B Instruct
除了基础模型,Mistral AI 还发布了 Mixtral 8x7B Instruct。该版本通过监督微调和直接偏好优化(DPO)进行了指令遵循优化。
指令遵循性能
在 MT-Bench 上,Mixtral 8x7B Instruct 得分为 8.30,是同类中最强的开源模型,性能可与 GPT-3.5 相媲美。
内容审核与防护
虽然可以通过提示让模型禁止特定输出以满足内容审核需求,但模型的基础行为是遵循所提供的指令,除非被特别提示或经过偏好微调,否则不会内置限制。
部署与生态系统
为支持开源社区,Mistral AI 已将 Megablocks CUDA 内核集成到 vLLM 项目中,以实现高效推理。可通过 Skypilot 在任何云实例上管理 vLLM 端点的部署。
Mixtral 8x7B 也作为 mistral-small 端点在 Mistral AI 平台的测试版中提供。
Sources
- OriginalMixtral of experts
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch