Mistral Large 2 リリースノート / 新機能

Mistral AIは、高スループットのシングルノード推論とコスト効率に最適化された1230億パラメータのモデル、Mistral Large 2をリリースしました。このモデルは、特にコーディング、推論、および多言語タスクにおいて、GPT-4o、Claude 3 Opus、Llama 3 405Bなどの主要なフロンティアモデルと競合するように設計されています。

モデルアーキテクチャとデプロイメント

Mistral Large 2は、128kのコンテキストウィンドウを備えた123Bパラメータのモデルです。長文コンテキストのアプリケーションにおいて高いスループットを維持できるよう、シングルノード推論向けに特別に設計されています。

ライセンスとアクセス

  • Research and Non-Commercial Use: Mistral Research License (MRL-0.1) の下で利用可能です。
  • Commercial Use: 自己デプロイメントには Mistral Commercial License が必要です。
  • API Access: la Plateforme (as mistral-large-2407) および le Chat を通じて利用可能です。
  • Cloud Providers: Google Cloud Vertex AI (Managed API), Azure AI Studio, Amazon Bedrock, および IBM watsonx.ai を通じて利用可能です。

技術的パフォーマンスとベンチマーク

Mistral Large 2は、前身モデルと比較して大幅な改善を示し、他の主要なオープンモデルに対しても競争力のあるパフォーマンスを発揮します。

一般知識と推論

MMLUベンチマークにおいて、Mistral Large 2の事前学習済みバージョンは84.0%の精度を達成し、オープンモデルにおけるパフォーマンス/コストのパレート最適(Pareto front)における新たな基準を確立しました。

コーディングと数学

Codestral 22B および Codestral Mamba の開発に続き、Mistral Large 2は高い割合のコードで学習されています。コード生成および推論タスクにおいて、GPT-4o、Claude 3 Opus、および Llama 3 405B と同等のパフォーマンスを発揮します。

ハルシネーションを減らすため、モデルはより慎重かつ識別的な判断ができるよう微調整されており、確信を持って回答できる十分な情報が不足している場合に、それを認めるように学習されています。この正確性への注力は、GSM8K (8-shot) および MATH (0-shot, no CoT) ベンチマークにおけるパフォーマンスの向上に反映されています。

指示への追従性とアライメント

Mistral Large 2は、MT-Bench、Wild Bench、および Arena Hard によって測定される、正確な指示への追従性と長いマルチターン会話の管理において、劇的な改善を示しています。

冗長な回答を生成することでスコアを上げる一部のモデルとは異なり、Mistral Large 2は簡潔さに最適化されています。この設計上の選択は、推論コストを削減し、ビジネスアプリケーションにおけるより迅速なインタラクションを促進することを目的としています。

多言語能力とツール使用

Mistral Large 2は、多言語データの高い割合で学習されているため、グローバルなビジネスユースケース向けに設計されています。

言語サポート

モデルは以下の言語において優れた性能を発揮します:

  • English, French, German, Spanish, Italian, Portuguese, Dutch, Russian, Chinese, Japanese, Korean, Arabic, and Hindi.

ツール使用とファンクションコーリング

モデルは強化された検索スキルとファンクションコーリング(function calling)機能を備えています。並列および逐次的なファンクションコールを実行できるように学習されており、複雑なビジネスアプリケーションのオーケストレーションに適しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch