Mistral NeMo 發布說明
Mistral AI 與 NVIDIA 合作推出 Mistral NeMo,這是一款 12B 參數模型,專為在同等規模下提供頂尖的推理能力、世界知識與程式碼準確性而設計。由於其依賴標準架構,此模型可直接取代使用 Mistral 7B 的系統。
模型架構與效能
Mistral NeMo 是一款 12B 參數模型,支援最大 128k token 的大型上下文視窗。該模型在訓練時已具備量化感知能力,可在不損失效能的情況下進行 FP8 推理。模型以預訓練基礎模型與指令微調檢查點兩種形式提供,並採用 Apache 2.0 授權。
多語言功能與 Tekken 分詞器
Mistral NeMo 經優化,適用於全球應用,尤其在英文、法文、德文、西班牙文、義大利文、葡萄牙文、中文、日文、韓文、阿拉伯文及印地文方面表現出色。為達成此目標,模型採用了一種稱為 Tekken 的新分詞器,基於 Tiktoken 架構。
Tekken 在超過 100 種語言上進行訓練,其壓縮效率優於先前 Mistral 模型所使用的 SentencePiece 分詞器。具體壓縮改進包括:
- 原始碼與歐洲語言: 原始碼、中文、義大利文、法文、德文、西班牙文與俄文的壓縮效率提升約 30%。
- 韓文與阿拉伯文: 壓縮效率提升 2 至 3 倍。
- 一般語言能力: 對約 85% 的語言,Tekken 的文字壓縮能力優於 Llama 3 分詞器。
指令微調與對齊
Mistral NeMo 經過先進的微調與對齊階段,相較於 Mistral 7B 在以下方面有顯著提升:
- 指令遵循: 更精準地遵循詳細指令。
- 推理能力: 增強的推理能力。
- 多輪對話: 更佳的多輪對話處理能力。
- 程式碼生成: 提升原始碼生成的準確性。
可用性與部署
Mistral NeMo 可透過多個管道供研究人員與企業使用:
- HuggingFace: 基礎模型與基礎指令模型的權重皆於此處提供。
- Mistral AI Tools: 可使用
mistral-inference執行模型,並透過mistral-finetune進行調整。 - la Plateforme: 以
open-mistral-nemo-2407名稱提供。 - NVIDIA NIM: 模型已打包為 NVIDIA NIM 推理微服務,可於 ai.nvidia.com 取得。
Sources
- OriginalMistral NeMo
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch