Mixtral 8x7B リリースノート

Mistral AI は、Apache 2.0 ライセンスの下でオープンな重みを持つ、高品質なスパース・ミックスチャート・オブ・エキスパート(SMoE)モデルである Mixtral 8x7B をリリースしました。このモデルは、パフォーマンスとコストのトレードオフを最適化するように設計されており、多くの標準ベンチマークで GPT-3.5 や Llama 2 70B と同等またはそれ以上の性能を発揮しながら、著しく低い推論遅延を維持しています。

スパース・ミックスチャート・オブ・エキスパート(SMoE)アーキテクチャ

Mixtral 8x7B は、スパース・ミックスチャート・オブ・エキスパートネットワークを使用しており、トークンあたりの計算コストが比例して増加することなく、合計パラメータ数を増加させることができます。

技術的実装

デコーダー専用モデルとして、Mixtral 8x7B は 8 つの異なるパラメータグループから選択するフィードフォワードブロックを採用しています。各レイヤーの各トークンに対して、ルーター・ネットワークがこれらの「エキスパート」のうち 2 つを選択し、それらの出力を加算して結合します。

パラメータ効率

このアーキテクチャにより、高い合計パラメータ数を維持しつつ、遅延を制御できます。Mixtral 8x7B は合計 46.7B のパラメータを持ちますが、1 トークンあたり実際に使用するのは 12.9B のパラメータのみです。その結果、12.9B パラメータモデルと同等の速度とコストで出力を生成できます。

パフォーマンスとベンチマーク

Mixtral 8x7B は、Llama 2 ファミリーおよび GPT-3.5 ベースモデルと比較して、効率性と品質の面で優れています。

一般的なベンチマーク

Mixtral 8x7B は、多くの標準ベンチマークで Llama 2 70B および GPT-3.5 と同等またはそれ以上の性能を発揮します。Llama 2 70B と比較して、Mixtral は 6 倍高速な推論を実現しています。

多言語対応能力

このモデルは、英語、フランス語、イタリア語、ドイツ語、スペイン語の 5 言語に精通しています。

特化した能力

  • コンテキスト窓: モデルは 32k トークンのコンテキストを処理できます。
  • コード生成: Mixtral はコード生成において優れた性能を発揮します。
  • バイアスとホールーシュレーション: BBQ ベンチマークでは、Llama 2 よりも少ないバイアスを示します。BOLD ベンチマークでは、Llama 2 と同程度の分散でよりポジティブな感情を示します。

Mixtral 8x7B Instruct

ベースモデルとともに、Mistral AI は Mixtral 8x7B Instruct をリリースしました。このバージョンは、教師あり微調整および直接的好み最適化(DPO)により、指示の順守を最適化しています。

指示順守のパフォーマンス

MT-Bench において、Mixtral 8x7B Instruct は 8.30 のスコアを達成し、GPT-3.5 と同等の性能を持つクラス最強のオープンソースモデルとなっています。

モデレーションとガードレール

モデレーションが必要なアプリケーション向けに、特定の出力を禁止するようにプロンプトを設定することは可能ですが、モデルの基本的な挙動は、明示的にプロンプトされたり好みに微調整されない限り、制限なしに提供された指示に従うものです。

デプロイとエコシステム

オープンソースコミュニティを支援するために、Mistral AI は Megablocks CUDA カーネルを vLLM プロジェクトに統合し、効率的な推論を実現しています。vLLM エンドポイントのデプロイは、任意のクラウドインスタンス上で Skypilot を使って管理できます。

Mixtral 8x7B は、Mistral AI プラットフォームのベータ版として mistral-small エンドポイントとしても利用可能です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch