Mixtral 8x7B 發布說明
Mistral AI 發布了 Mixtral 8x7B,這是一款高品質的稀疏專家混合模型(SMoE),採用 Apache 2.0 許可證開放權重。此模型旨在優化效能與成本之間的權衡,在大多數標準基準測試中表現與 GPT-3.5 或 Llama 2 70B 相當甚至更優,同時保持顯著更低的推論延遲。
稀疏專家混合(SMoE)架構
Mixtral 8x7B 採用稀疏專家混合網路,使模型能在不按比例增加每 token 計算成本的情況下提升總參數數量。
技術實作
作為僅解碼器模型,Mixtral 8x7B 使用一個前饋模塊,從八個不同的參數群組中進行選擇。在每一層的每個 token 上,路由器網路會選擇兩個「專家」來處理該 token,並以加法方式結合其輸出。
參數效率
此架構可在控制延遲的同時實現高總參數數量。Mixtral 8x7B 總共擁有 467 億個參數,但每 token 僅使用 129 億個參數。因此,該模型的輸出生成速度與成本與 129 億參數模型相當。
性能與基準測試
Mixtral 8x7B 在效率與品質方面均優於 Llama 2 系列與 GPT-3.5 基礎模型。
通用基準測試
Mixtral 在大多數標準基準測試中表現與 Llama 2 70B 或 GPT-3.5 相當甚至更優。與 Llama 2 70B 相比,Mixtral 推論速度快 6 倍。
多語言能力
該模型精通五種語言:英文、法文、義大利文、德文與西班牙文。
專業能力
- 上下文視窗: 模型可處理 32k token 的上下文。
- 程式碼生成: Mixtral 在生成程式碼方面表現出色。
- 偏見與幻覺: 在 BBQ 基準測試中,Mixtral 的偏見程度低於 Llama 2。在 BOLD 基準測試中,其情感傾向比 Llama 2 更為正面,且各維度的變異程度相近。
Mixtral 8x7B Instruct
除了基礎模型外,Mistral AI 也發布了 Mixtral 8x7B Instruct。此版本透過監督微調與直接偏好優化(DPO)進行優化,以提升指令遵循能力。
指令遵循表現
在 MT-Bench 上,Mixtral 8x7B Instruct 取得 8.30 分,使其成為同類別中表現最強的開源模型,效能與 GPT-3.5 相當。
模式與防護機制
雖然可透過提示要求模型禁止特定輸出以適用於需要內容審核的應用,但模型的預設行為是遵循所提供的指令,除非特別提示或經過偏好微調,否則不會內建限制。
部署與生態系統
為支援開源社群,Mistral AI 已將 Megablocks CUDA 核心整合至 vLLM 項目,以實現高效推論。透過 Skypilot 可在任何雲端實例上管理 vLLM 端點的部署。
Mixtral 8x7B 也作為 Mistral AI 平台上的 mistral-small 端點(測試版)提供。
Sources
- OriginalMixtral of experts
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch