Mistral AI 发布 Ministral 3B 和 8B 边缘模型
Mistral AI 宣布发布 Ministral 3B 和 Ministral 8B,这是两款针对边缘计算和设备端使用场景优化的新型小语言模型 (SLMs)。这些模型旨在提供高性能的知识、推理和函数调用能力,同时保持本地部署所需的低延迟和高效率。
技术规格与架构
Ministral 3B 和 8B 都支持高达 128k tokens 的上下文长度,不过目前在 vLLM 上为 32k。为了优化性能,Ministral 8B 采用了特殊的交错滑动窗口注意力机制 (interleaved sliding-window attention pattern),从而实现更快速、更具内存效率的推理。
目标使用场景与应用
Les Ministraux 是为需要本地、隐私优先的推理和低延迟的场景而构建的。关键应用包括:
- 设备端计算: 本地分析、无网络智能助手以及自主机器人。
- 边缘翻译: 设备端翻译服务。
- 智能体工作流 (Agentic workflows): 当与 Mistral Large 等大型模型配合使用时,可作为函数调用、输入解析和任务路由的高效中介。
性能基准测试
Mistral AI 报告称,Ministral 3B 和 8B 在 10B 以下类别中持续优于同类产品。根据公司的内部评估框架,最小的模型 Ministral 3B 在大多数基准测试中已经优于原始的 Mistral 7B。
可用性、定价与许可
两款模型均已通过 API 立即可用。la Plateforme 上的定价如下:
| Model | API Endpoint | Price per Million Tokens (Input/Output) | License |
|---|---|---|---|
| Ministral 8B | ministral-8b-latest |
$0.10 | Mistral Commercial License / Mistral Research License |
| Ministral 3B | ministral-3b-latest |
$0.04 | Mistral Commercial License |
对于自行部署的使用,需要商业许可。Mistral AI 还提供无损量化方面的协助,以针对特定使用场景实现性能最大化。Ministral 8B Instruct 的模型权重可用于研究用途,且两款模型很快将通过云合作伙伴提供。
Sources
- OriginalUn Ministral, des Ministraux
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch