Mixtral 8x22B リリースノート

Mistral AI は、高いパフォーマンスとコスト効率を実現するためのスパースな Mixture-of-Experts (SMoE) モデルである Mixtral 8x22B のリリースを発表しました。このモデルは、合計 141B のパラメータのうち 39B のパラメータをアクティブに使用しており、70B の密なモデルよりも高速でありながら、高いパフォーマンス対コスト比を維持しています。

アーキテクチャと効率性

Mixtral 8x22B はスパースな Mixture-of-Experts モデルとして構築されており、推論時に全パラメータの一部のみをアクティブにします。39B のアクティブパラメータと 141B の合計パラメータを持つこのモデルは、コスト効率と速度を重視して設計されています。Mistral AI によると、このアーキテクチャにより、任意の密な 70B モデルよりも高速であり、許容的なライセンスと制限のあるライセンスの両方で利用可能な他のオープンウェイトモデルよりも優れた能力を発揮します。

主な機能と技術仕様

Mixtral 8x22B は以下の主要な技術的強みを備えています:

  • 多言語対応: モデルは英語、フランス語、イタリア語、ドイツ語、スペイン語に流暢に対応しています。
  • コンテキストウィンドウ: 64K トークンのコンテキストウィンドウを備えており、大規模なドキュメントからの正確な情報の再現が可能です。
  • 関数呼び出し: モデルは関数呼び出しをネイティブにサポートしています。la Plateforme の制約付き出力モードと組み合わせることで、大規模なアプリケーション開発やテックスタックの近代化が可能になります。
  • 推論、数学、コーディング: モデルは推論に最適化されており、他のオープンモデルと比較して数学およびコーディングタスクにおいて優れたパフォーマンスを発揮します。

パフォーマンスベンチマーク

Mixtral 8x22B は、いくつかの業界標準ベンチマークで優れたパフォーマンスを示しています。

推論と知識

モデルは推論に最適化されており、MMLU(Measuring massive multitask language in understanding)、HellaSwag、Wino Grande、Arc Challenge、TriviaQA、NaturalQS などのベンチマークでリーダークラスのパフォーマンスを発揮しています。

多言語性能

Mixtral 8x22B は、フランス語、ドイツ語、スペイン語、イタリア語において、LLaMA 2 70B に対して HellaSwag、Arc Challenge、MMLU ベンチマークで優れた性能を発揮しています。

数学とコーディング

他のオープンモデルと比較して、Mixtral 8x22B はコーディングおよび数学タスクで最も優れたパフォーマンスを示しています。インストラクション版のモデルは GSM8K maj@8 で 90.8%、Math maj@4 で 44.6% のスコアを達成しています。

ライセンスと利用可能範囲

Mixtral 8x22B は Apache 2.0 ライセンスの下でリリースされており、最も許容的なオープンソースライセンスの一つであり、制限なく使用可能です。ベースモデルの利用可能性により、ファインチューニング用途の適切な基盤としても利用できます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch