Mistral Small 3 发布说明
Mistral AI 推出了 Mistral Small 3,这是一个专为低延迟生成式 AI 任务设计的 240 亿参数模型。该模型采用 Apache 2.0 许可证发布,被定位为 Llama 3.3 70B 和 Qwen 32B 等大型开源权重模型,以及 GPT-4o-mini 等专有模型的高效替代方案。
高效性能与低延迟
Mistral Small 3 经过优化,可在适合本地部署的规模下实现性能饱和。相比竞争模型,它使用了更少的层数,显著减少了每次前向传播所需的时间,实现了每秒 150 个 token 的延迟。
关键性能指标包括:
- MMLU 准确率:超过 81%。
- 速度:在同一硬件上,比 Llama 3.3 70B Instruct 快 3 倍以上。
- 效率:Mistral AI 称其为该类别中最高效的模型。
模型能力与训练
Mistral AI 已发布预训练和指令微调的检查点。与一些当代推理模型不同,Mistral Small 3 并未使用强化学习(RL)或合成数据进行训练。Mistral AI 指出,该模型在生产流程中比 DeepSeek R1 等模型更早,因此是开发者构建累积推理能力的强劲基础模型。
目标应用场景
Mistral Small 3 针对生成式 AI 中 80% 的任务进行了优化,这些任务需要强大的指令遵循能力与语言表现,同时延迟极低。推荐的应用场景包括:
- 对话式辅助:需要近实时交互的快速响应虚拟助手。
- 智能体工作流:用于自动化流程的低延迟函数调用。
- 领域专业化:通过微调模型,创建医学诊断、法律咨询和技术支持等领域的专家。
- 本地推理:在量化后,可在单张 RTX 4090 或配备 32GB 内存的 MacBook 上私有部署。
客户当前正在评估的行业特定应用包括金融领域的欺诈检测、医疗领域的客户分诊,以及汽车、机器人和制造领域的设备端命令与控制。
可用性与生态系统
Mistral Small 3 可通过 mistral-small-latest 或 mistral-small-2501 在 la Plateforme 上获取。它还通过 Hugging Face、Ollama、Kaggle、Together AI、Fireworks AI 和 IBM Watson X 等合作伙伴提供。预计不久将支持 NVIDIA NIM、Amazon SageMaker、Groq、Databricks 和 Snowflake 的集成。
对开源的承诺
Mistral AI 正重新承诺对通用模型采用 Apache 2.0 许可证,逐步放弃 MRL 许可证模型。这使得模型权重可以自由下载、本地部署和修改。
Sources
- OriginalMistral Small 3
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch