Mixtral 8x22B 發佈說明

Mistral AI 已宣佈發佈 Mixtral 8x22B,這是一款稀疏混合專家模型 (SMoE),旨在提供高性能與成本效益。該模型在總共 141B 的參數中利用了 39B 的活躍參數,使其在保持高性價比的同時,速度仍比稠密 (dense) 70B 模型更快。

架構與效率

Mixtral 8x22B 是以稀疏混合專家模型構建的,這意味著它在推理過程中僅會激活其總參數的一小部分。憑藉 39B 的活躍參數和 141B 的總參數,該模型專為成本效益和速度而設計。Mistral AI 表示,這種架構使該模型比任何稠密 70B 模型都更快,並且比其他在寬鬆或限制性許可證下提供的開源權重模型更具能力。

關鍵能力與技術規格

Mixtral 8x22B 提供幾項核心技術優勢:

  • 多語言能力: 該模型精通英語、法語、義大利語、德語和西班牙語。
  • 上下文窗口: 它具有 64K token 的上下文窗口,能夠從大型文件中精確地召回資訊。
  • 函數調用 (Function Calling): 該模型原生具備函數調用能力。當與 la Plateforme 上的受限輸出模式結合使用時,這能支持大規模應用開發和技術棧現代化。
  • 推理、數學與程式碼: 該模型針對推理進行了優化,與其他開源模型相比,在數學和程式碼任務中展現出強大的性能。

性能基準測試

Mixtral 8x22B 在多項行業基準測試中展現了卓越的性能:

推理與知識

該模型針對推理進行了優化,並在包括 MMLU (Measuring massive multitask language in understanding)、HellaSwag、Wino Grande、Arc Challenge、TriviaQA 和 NaturalQS 在內的基準測試中展現了領先的性能。

多語言性能

Mixtral 8x22B 在 HellaSwag、Arc Challenge 和 MMLU 基準測試中,特別是在法語、德語、西班牙語和義大利語方面,表現優於 LLaMA 2 70B。

數學與程式碼

與其他開源模型相比,Mixtral 8x22B 在程式碼和數學任務中表現最佳。該模型的指令版本 (instructed version) 在 GSM8K maj@8 上獲得了 90.8% 的分數,並在 Math maj@4 上獲得了 44.6% 的分數。

許可證與可用性

Mixtral 8x22B 是根據 Apache 2.0 許可證發佈的,這是最寬鬆的開源許可證,允許不受限制的使用。基礎模型 (base model) 的可用性也使其成為微調 (fine-tuning) 使用場景的理想基礎。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch