Mistral Large 2 發佈說明 / 有什麼新功能
Mistral AI 已發佈 Mistral Large 2,這是一個擁有 1230 億參數的模型,針對高吞吐量單節點推理與成本效益進行了優化。此模型旨在與 GPT-4o、Claude 3 Opus 和 Llama 3 405B 等領先的前沿模型競爭,特別是在程式碼編寫、推理和多語言任務方面。
模型架構與部署
Mistral Large 2 是一個擁有 128k 上下文窗口的 123B 參數模型。它專為單節點推理而設計,使其能夠在長上下文應用中保持高吞吐量。
授權與存取方式
- 研究與非商業用途:根據 Mistral Research License (MRL-0.1) 提供。
- 商業用途:自行部署需要 Mistral Commercial License。
- API 存取:可透過 la Plateforme (作為
mistral-large-2407) 和 le Chat 使用。 - 雲端供應商:可透過 Google Cloud Vertex AI (Managed API)、Azure AI Studio、Amazon Bedrock 和 IBM watsonx.ai 使用。
技術性能與基準測試
Mistral Large 2 展現了較其前身顯著的改進,並在與其他領先的開源模型競爭時展現了具競爭力的性能。
一般知識與推理
在 MMLU 基準測試中,Mistral Large 2 的預訓練版本達到了 84.0% 的準確率,在開源模型的性能/成本 Pareto 前沿上建立了一個新的點。
程式碼編寫與數學
繼 Codestral 22B 和 Codestral Mamba 的開發之後,Mistral Large 2 在高比例的程式碼數據上進行了訓練。它在程式碼生成和推理任務中的表現與 GPT-4o、Claude 3 Opus 和 Llama 3 405B 持平。
為了減少幻覺,該模型經過微調,使其更加謹慎且具辨別力,訓練它在缺乏足夠資訊以提供信心十足的答案時,能夠承認其不足。這種對準確性的關注反映在 GSM8K (8-shot) 和 MATH (0-shot, no CoT) 基準測試性能的提升上。
指令遵循與對齊
Mistral Large 2 在遵循精確指令和管理長篇多輪對話方面展現了巨大的改進,這可以透過 MT-Bench、Wild Bench 和 Arena Hard 進行衡量。
與某些透過生成冗長回答來提高分數的模型不同,Mistral Large 2 針對簡潔性進行了優化。這種設計選擇旨在降低推理成本並促進商業應用中的快速互動。
多語言能力與工具使用
Mistral Large 2 透過在大量多語言數據上進行訓練,旨在用於全球商業使用場景。
語言支持
該模型在以下語言中表現出色:
- English, French, German, Spanish, Italian, Portuguese, Dutch, Russian, Chinese, Japanese, Korean, Arabic, and Hindi.
工具使用與函式呼叫
該模型配備了增強的檢索技能與函式呼叫能力。它經過訓練可以執行平行與順序的函式呼叫,使其適用於複雜的商業應用編排。
Sources
- OriginalLarge Enough
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch