Mistral NeMo 發布說明

Mistral AI 與 NVIDIA 合作推出 Mistral NeMo,這是一款 12B 參數模型,專為在同等規模下提供頂尖的推理能力、世界知識與程式碼準確性而設計。由於其依賴標準架構,此模型可直接取代使用 Mistral 7B 的系統。

模型架構與效能

Mistral NeMo 是一款 12B 參數模型,支援最大 128k token 的大型上下文視窗。該模型在訓練時已具備量化感知能力,可在不損失效能的情況下進行 FP8 推理。模型以預訓練基礎模型與指令微調檢查點兩種形式提供,並採用 Apache 2.0 授權。

多語言功能與 Tekken 分詞器

Mistral NeMo 經優化,適用於全球應用,尤其在英文、法文、德文、西班牙文、義大利文、葡萄牙文、中文、日文、韓文、阿拉伯文及印地文方面表現出色。為達成此目標,模型採用了一種稱為 Tekken 的新分詞器,基於 Tiktoken 架構。

Tekken 在超過 100 種語言上進行訓練,其壓縮效率優於先前 Mistral 模型所使用的 SentencePiece 分詞器。具體壓縮改進包括:

  • 原始碼與歐洲語言: 原始碼、中文、義大利文、法文、德文、西班牙文與俄文的壓縮效率提升約 30%。
  • 韓文與阿拉伯文: 壓縮效率提升 2 至 3 倍。
  • 一般語言能力: 對約 85% 的語言,Tekken 的文字壓縮能力優於 Llama 3 分詞器。

指令微調與對齊

Mistral NeMo 經過先進的微調與對齊階段,相較於 Mistral 7B 在以下方面有顯著提升:

  • 指令遵循: 更精準地遵循詳細指令。
  • 推理能力: 增強的推理能力。
  • 多輪對話: 更佳的多輪對話處理能力。
  • 程式碼生成: 提升原始碼生成的準確性。

可用性與部署

Mistral NeMo 可透過多個管道供研究人員與企業使用:

  • HuggingFace: 基礎模型與基礎指令模型的權重皆於此處提供。
  • Mistral AI Tools: 可使用 mistral-inference 執行模型,並透過 mistral-finetune 進行調整。
  • la Plateforme:open-mistral-nemo-2407 名稱提供。
  • NVIDIA NIM: 模型已打包為 NVIDIA NIM 推理微服務,可於 ai.nvidia.com 取得。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch