Mistral 3 发布说明:Mistral Large 3 与 Ministral 3 系列
Mistral AI 发布了 Mistral 3,这是新一代模型,包括高容量的 Mistral Large 3 和专注于边缘侧的 Ministral 3 系列。此版本中的所有模型均在 Apache 2.0 许可下提供,以支持分布式智能和开发者定制。
Mistral Large 3:前沿开源权重性能
Mistral Large 3 是一款稀疏混合专家(MoE)模型,具有 675B 总参数量和 41B 激活参数量。该模型在 3,000 块 NVIDIA H200 GPU 上从头开始训练,旨在针对通用提示词实现与领先的指令微调开源权重模型相当的性能。
关键能力和基准测试包括:
- LMArena 排名:Mistral Large 3 在 LMArena 排行榜上,在 OSS 非推理模型类别中排名第 2,在所有 OSS 模型中总排名第 6。
- 多模态与多语言:该模型展示了图像理解能力,并在非英语和非中文语言的多语言对话中表现出同类最佳的性能。
- 可用性:基础版(Base)和指令微调版(Instruct)于今日发布,推理版(Reasoning)计划在未来发布。
Ministral 3:边缘侧优化智能
The Ministral 3 系列为本地和边缘部署提供了最先进的性能功耗比。该系列包含三种模型规模:3B、8B 和 14B 参数。
对于每种规模,Mistral AI 发布了三个变体:
- Base:基础预训练模型。
- Instruct:针对遵循指令进行了优化;这些模型在匹配或超过同类模型性能的同时,通常生成的 token 数量少一个数量级。
- Reasoning:专为高精度任务设计,其中 14B 变体在 AIME ’25 上达到了 85% 的准确率。
所有 Ministral 3 模型都包含原生多模态(图像理解)和多语言能力。
硬件优化与生态系统集成
Mistral AI 与 NVIDIA、vLLM 和 Red Hat 合作,以确保 Mistral 3 在各种硬件环境中都能高效访问和使用。
数据中心与企业级部署
- NVFP4 格式:使用
llm-compressor创建的 NVFP4 格式检查点(checkpoint),允许 Mistral Large 3 在 Blackwell NVL72 系统或使用 vLLM 在单个 8×A100 或 8×H100 节点上高效运行。 - NVIDIA 集成:所有 Mistral 3 模型均在配备 HBM3e 内存的 NVIDIA Hopper GPU 上训练。NVIDIA 为 TensorRT-LLM 和 SGLang 提供了推理支持,以实现低精度执行。
- 高级内核:针对 Large 3 的 MoE 架构,NVIDIA 集成了 Blackwell attention 和 MoE 内核,并就投机采样(speculative decoding)进行了合作,以支持在 GB200 NVL72 上的长上下文、高吞吐量工作负载。
边缘侧与本地部署
- 设备支持:Ministral 模型针对在 DGX Spark、RTX PC、笔记本电脑和 Jetson 设备上的部署进行了优化。
可用性与定制化
Mistral 3 可通过 Mistral AI Studio、Amazon Bedrock、Azure Foundry、Hugging Face、Modal、IBM WatsonX、OpenRouter、Fireworks、Unsloth AI 和 Together AI 获取。它很快也将通过 NVIDIA NIM 和 AWS SageMaker 提供。
对于需要专业化 AI 的组织,Mistral AI 提供定制模型训练服务,以针对特定领域任务或私有数据集进行模型微调或完全适配。
Sources
- OriginalIntroducing Mistral 3
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch