Mistral Small 3 發佈說明
Mistral AI 推出了 Mistral Small 3,這是一個擁有 24B 參數的模型,專為低延遲生成式 AI 任務而設計。該模型採用 Apache 2.0 授權,定位為 Llama 3.3 70B 和 Qwen 32B 等較大型開源權重模型,以及 GPT-4o-mini 等專有模型的更高效替代方案。
高效率性能與延遲
Mistral Small 3 旨在於適合本地部署的規模下達到性能飽和。透過使用比競爭模型更少的層數,它大幅減少了每次前向傳播所需的時間,實現了每秒 150 個 token 的延遲。
關鍵性能指標包括:
- MMLU 準確度:超過 81%。
- 速度:在相同硬體上比 Llama 3.3 70B Instruct 快 3 倍以上。
- 效率:Mistral AI 將其描述為同類別中最有效率的模型。
模型能力與訓練
Mistral AI 同時發佈了預訓練(pretrained)和指令微調(instruction-tuned)的檢查點(checkpoints)。與某些當代的推理模型不同,Mistral Small 3 並未使用強化學習(RL)或合成數據進行訓練。Mistral AI 指出,該模型在生產管線中處於較早階段,比 DeepSeek R1 等模型更早,這使其成為開發者構建累積推理能力的強大基礎模型。
目標使用場景
Mistral Small 3 針對生成式 AI 任務中佔「80%」的部分進行了優化,這些任務需要強大的指令遵循能力和語言性能,且延遲極低。推薦的使用場景包括:
- 對話式輔助:需要近乎即時互動的快速響應虛擬助手。
- 代理式工作流(Agentic Workflows):用於自動化流程的低延遲函數調用(function calling)。
- 領域專業化:微調模型以在醫療診斷、法律建議和技術支持等領域創建領域專家。
- 本地推理:在量化後,可於單張 RTX 4090 或配備 32GB RAM 的 MacBook 上進行私有化部署。
目前客戶正在評估的特定行業應用包括金融服務中的欺詐檢測、醫療保健中的客戶分流,以及汽車、機器人與製造業的裝置端指令與控制。
可用性與生態系統
Mistral Small 3 可透過 la Plateforme 上的 mistral-small-latest 或 mistral-small-2501 使用。它也透過合作夥伴提供,包括 Hugging Face、Ollama、Kaggle、Together AI、Fireworks AI 和 IBM Watson X。預計很快就會與 NVIDIA NIM、Amazon SageMaker、Groq、Databricks 和 Snowflake 完成整合。
對開源的承諾
Mistral AI 正在重新履行其對通用模型採用 Apache 2.0 授權的承諾,從 MRL 授權模型轉向 Apache 2.0。這允許模型權重被下載、本地部署並自由修改。
Sources
- OriginalMistral Small 3
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch