Mistral Small 4 发布说明 / 更新内容
Mistral AI 宣布发布 Mistral Small 4,这是一个统一模型,它将 Magistral(推理)、Pixtral(多模态)和 Devstral(智能体编码)的能力整合到一个单一架构中。此次发布消除了用户在不同任务之间切换专门模型的必要性,提供了一个具有可配置推理强度且高效的多功能工具。
统一模型能力
Mistral Small 4 将之前三个不同的模型优势整合到一个系统中:
- 推理: 源自 Magistral 的能力。
- 多模态: 源自 Pixtral 的图像和文本输入支持。
- 智能体编码: 源自 Devstral 的编码自动化和智能体工作流。
这种统一化使得模型可以作为聊天助手、研究伙伴或编码智能体,而无需用户根据任务更改模型。
技术架构与规格
Mistral Small 4 是一个利用混合专家(MoE)架构的混合模型。关键技术规格包括:
- 参数量: 总参数量为 119B,每个 token 的激活参数量为 6B(包括嵌入层和输出层共 8B)。
- 专家配置: 128 个专家,每个 token 激活 4 个。
- 上下文窗口: 256k tokens,支持长篇文档分析和交互。
- 输入支持: 原生多模态,允许文本和图像输入。
- 许可: 根据 Apache 2.0 许可发布。
可配置的推理强度
该模型引入了 reasoning_effort 参数,允许用户动态调整模型的处理深度:
reasoning_effort="none":为日常任务提供快速、轻量级的响应,类似于 Mistral Small 3.2 的聊天风格。reasoning_effort="high":为复杂问题启用深度、逐步推理,其详细程度与之前的 Magistral 模型相匹配。
性能与效率
Mistral Small 4 与 Mistral Small 3 相比,在吞吐量和延迟方面表现出显著改进:
- 延迟: 在延迟优化设置中,端到端完成时间减少了 40%。
- 吞吐量: 在吞吐量优化设置中,每秒请求数增加了 3 倍。
在基准测试对比中,具备推理能力的 Mistral Small 4 在三个基准测试中达到或超过了 GPT-OSS 120B,同时生成的输出更短。在 AA LCR 基准测试中,它使用 1.6K 字符获得 0.72 分,而 Qwen 模型在达到类似性能时需要多出 3.5-4 倍的输出(5.8-6.1K 字符)。在 LiveCodeBench 上,它的表现优于 GPT-OSS 120B,同时产生的输出减少了 20%。
部署与基础设施要求
Mistral Small 4 针对 NVIDIA 硬件进行了优化,并且是 NVIDIA Nemotron Coalition 的创始成员。部署选项包括:
基础设施层级
- 最低基础设施: 4x NVIDIA HGX H100, 2x NVIDIA HGX H200, 或 1x NVIDIA DGX B200。
- 推荐配置: 4x NVIDIA HGX H100, 4x NVIDIA HGX H200, 或 2x NVIDIA DGX B200 以获得最佳性能。
可用性与集成
- 平台: 可通过 Mistral API, AI Studio, 和 Hugging Face 使用。
- 框架: 支持 vLLM, llama.cpp, SGLang, 和 Transformers。
- NVIDIA 集成: 可作为 NVIDIA NIM 用于容器化推理,并可通过 NVIDIA NeMo 进行领域特定微调。
- 原型设计: 可在 build.nvidia.com 进行免费原型设计。
Sources
- OriginalIntroducing Mistral Small 4
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch