Mistral Small 4 發佈說明 / 有什麼新功能

Mistral AI 已宣布發佈 Mistral Small 4,這是一個統一模型,將 Magistral (reasoning)、Pixtral (multimodal) 和 Devstral (agentic coding) 的能力整合進單一架構中。此次發佈消除了使用者在不同任務間切換專業化模型的必要性,提供了一個具有可配置推理強度且高效能的通用工具。

統一模型能力

Mistral Small 4 將先前三個不同的模型優勢整合進一個系統中:

  • Reasoning: 來自 Magistral 的能力。
  • Multimodal: 來自 Pixtral 的圖像與文本輸入支援。
  • Agentic Coding: 來自 Devstral 的程式碼自動化與代理工作流。

這種統一化讓模型可以擔任聊天助手、研究夥伴或程式碼代理,而不需要使用者根據任務更換模型。

技術架構與規格

Mistral Small 4 是一個利用 Mixture of Experts (MoE) 架構的混合模型。關鍵技術規格包括:

  • Parameter Count: 119B 總參數,每個 token 的啟動參數為 6B (包含 embedding 與 output layers 為 8B)。
  • Expert Configuration: 128 個專家,每個 token 啟動 4 個專家。
  • Context Window: 256k tokens,支援長篇文件分析與互動。
  • Input Support: 原生多模態,允許文本與圖像輸入。
  • Licensing: 以 Apache 2.0 授權條款發佈。

可配置的推理強度

該模型引入了 reasoning_effort 參數,允許使用者動態調整模型的處理深度:

  • reasoning_effort="none": 為日常任務提供快速、輕量化的回應,模擬 Mistral Small 3.2 的聊天風格。
  • reasoning_effort="high": 為複雜問題啟用深度的、逐步的推理,達到與先前 Magistral 模型相當的詳細程度。

效能與效率

Mistral Small 4 與 Mistral Small 3 相比,在吞吐量與延遲方面展現了顯著的改進:

  • Latency: 在延遲優化的配置中,端到端完成時間減少了 40%。
  • Throughput: 在吞吐量優化的配置中,每秒請求數增加了 3 倍。

在基準測試比較中,具備推理能力的 Mistral Small 4 在三項基準測試中達到或超越了 GPT-OSS 120B,同時產生的輸出更短。在 AA LCR 基準測試中,它使用 1.6K 字元獲得 0.72 分,而 Qwen 模型在達到相似效能時需要 3.5-4 倍更多的輸出 (5.8-6.1K 字元)。在 LiveCodeBench 上,它的表現優於 GPT-OSS 120B,同時產生的輸出減少了 20%。

部署與基礎設施需求

Mistral Small 4 已針對 NVIDIA 硬體進行優化,並且是 NVIDIA Nemotron Coalition 的創始成員。部署選項包括:

Infrastructure Tiers

  • Minimum Infrastructure: 4x NVIDIA HGX H100, 2x NVIDIA HGX H200, 或 1x NVIDIA DGX B200。
  • Recommended Setup: 4x NVIDIA HGX H100, 4x NVIDIA HGX H200, 或 2x NVIDIA DGX B200 以獲得最佳效能。

Availability and Integration

  • Platforms: 可透過 Mistral API, AI Studio, 與 Hugging Face 使用。
  • Frameworks: 支援 vLLM, llama.cpp, SGLang, 與 Transformers。
  • NVIDIA Integration: 可作為 NVIDIA NIM 進行容器化推理,並可透過 NVIDIA NeMo 進行領域特定微調。
  • Prototyping: 可在 build.nvidia.com 進行免費原型開發。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch