Mistral 3 發佈說明:Mistral Large 3 與 Ministral 3 系列

Mistral AI 已宣布推出 Mistral 3,這是新一代的模型,包括高容量的 Mistral Large 3 以及專注於邊緣運算的 Ministral 3 系列。此版本中的所有模型均採用 Apache 2.0 授權,以支援分散式智慧與開發者自定義。

Mistral Large 3:尖端開源權重性能

Mistral Large 3 是一款稀疏混合專家 (MoE) 模型,具有 675B 總參數與 41B 活躍參數。該模型使用 3,000 顆 NVIDIA H200 GPU 從頭開始訓練,旨在針對一般提示詞達到與領先的指令微調開源權重模型相當的性能。

關鍵能力與基準測試包括:

  • LMArena 排名:Mistral Large 3 在 LMArena 排行榜上,於 OSS 非推理模型類別中排名第 2,並在所有 OSS 模型中總排名第 6。
  • 多模態與多語言:該模型展現了圖像理解能力,並在非英語與非中文語言的多語言對話中表現出同類最佳的性能。
  • 可用性:基礎版與指令微調版於今日發佈,推理版預計於未來發佈。

Ministral 3:邊緣優化智慧

Ministral 3 系列為本地與邊緣部署提供了頂尖的性能與成本效益比。該系列包含三種模型大小:3B、8B 與 14B 參數。

針對每種大小,Mistral AI 已發佈三種變體:

  • Base:基礎預訓練模型。
  • Instruct:針對遵循指令進行優化;這些模型在生成 token 數量通常比同類模型少一個數量級的同時,能達到或超越同類模型。
  • Reasoning:專為高準確度任務設計,其中 14B 變體在 AIME ’25 上達到了 85% 的準確度。

所有 Ministral 3 模型均包含原生多模態(圖像理解)與多語言能力。

硬體優化與生態系統整合

Mistral AI 與 NVIDIA、vLLM 與 Red Hat 合作,以確保 Mistral 3 在各種硬體環境中皆能高效存取與運行。

資料中心與企業部署

  • NVFP4 格式:使用 llm-compressor 建立的 NVFP4 格式檢查點,可讓 Mistral Large 3 在 Blackwell NVL72 系統或使用 vLLM 的單個 8×A100 或 8×H100 節點上高效運行。
  • NVIDIA 整合:所有 Mistral 3 模型均使用 HBM3e 記憶體在 NVIDIA Hopper GPU 上進行訓練。NVIDIA 為 TensorRT-LLM 與 SGLang 提供了推理支援,以實現低精度執行。
  • 進階核心 (Kernels):針對 Large 3 的 MoE 架構,NVIDIA 整合了 Blackwell attention 與 MoE kernels,並在投機解碼 (speculative decoding) 方面進行了合作,以支援 GB200 NVL72 上的長上下文與高吞吐量工作負載。

邊緣與本地部署

  • Device Support:Ministral 模型已針對 DGX Spark、RTX PC、筆記型電腦與 Jetson 裝置進行部署優化。

可用性與自定義

Mistral 3 可透過 Mistral AI Studio、Amazon Bedrock、Azure Foundry、Hugging Face、Modal、IBM WatsonX、OpenRouter、Fireworks、Unsloth AI 與 Together AI 使用。它很快就會在 NVIDIA NIM 與 AWS SageMaker 上線。

對於需要專業化 AI 的組織,Mistral AI 提供自定義模型訓練服務,以針對特定領域任務或專有數據集微調或完全適配模型。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch