Pixtral Large リリースノート

Mistral AIは、最先端レベルの画像理解のために設計された124Bオープンウェイト・マルチモーダルモデルであるPixtral Largeを発表しました。Mistral Large 2をベースに構築されたこのモデルは、ベースモデルの元のテキストのみの理解能力を損なうことなく、ドキュメント、チャート、および自然画像の高性能な処理を可能にします。

モデルアーキテクチャと仕様

Pixtral Largeは、マルチモーダルデコーダーとビジョンエンコーダーを使用して、視覚的およびテキストデータを処理します。その技術仕様は以下の通りです:

  • パラメータ: 123Bマルチモーダルデコーダーと1Bパラメータのビジョンエンコーダーの組み合わせ(合計124B)。
  • コンテキストウィンドウ: 128Kのコンテキストウィンドウを備え、最低30枚の高解像度画像を収容可能です。
  • 利用可能性: このモデルは、Mistral API経由のpixtral-large-latest、le Chat、およびHuggingFace上のオープンウェイトとして利用可能です。
  • ライセンス: 研究および教育目的にはMistral Research License (MRL)、商用および商用実験目的には別のMistral Commercial Licenseの下で配布されます。

パフォーマンスベンチマーク

Pixtral Largeは、いくつかのマルチモーダルベンチマークにおいて最先端のパフォーマンスを示しており、オープンウェイトおよびプロプライエタリなモデルの両方を頻繁に上回っています。

数学的およびドキュメント推論

視覚データに対する複雑な数学的推論をテストするMathVistaベンチマークにおいて、Pixtral Largeは69.4%のスコアを達成し、テストされた他のすべてのモデルを上回りました。ChartQAおよびDocVQAを使用した複雑なチャートやドキュメントの評価において、このモデルはGPT-4oおよびGemini-1.5 Proのパフォーマンスを凌駕しました。

実世界および人間による好みの評価

Pixtral Largeは、実世界のマルチモーダルLLMユースケースを反映するように設計されたオープンソースの判定ベースの評価であるMM-MT-Benchにおいて、Claude-3.5 Sonnet (new)、Gemini-1.5 Pro、およびGPT-4o (latest)を上回りました。さらに、LMSys Vision Leaderboardにおいて、Pixtral Largeは最もランクの高いオープンウェイトモデルであり、最も近い競合相手を50 ELOポイント近く上回り、GPT-4oの2024年8月版のようなプロプライエタリなモデルをも上回っています。

視覚的理解能力

Pixtral Largeは、以下を含むさまざまな視覚的フォーマットにわたる複雑な推論が可能です:

  • 多言語OCRおよび推論: モデルは画像(異なる言語のレシートなど)からデータを抽出し、そのデータに基づいて数学的計算を実行できます。
  • チャート分析: モデルは、損失曲線グラフにおいてトレーニング損失の不安定性が始まる正確なステップ数を特定するなど、技術的なデータにおける特定の傾向や異常を特定できます。
  • 視覚的情報の抽出: モデルは、ウェブサイトのスクリーンショットからエンティティ(会社名など)を正確に特定し、リストアップできます。

Mistral Large 24.11 アップデート

Pixtral Largeのリリースと同時に、Mistral AIは最先端のテキストモデルをバージョン24.11にアップデートしました。このアップデートは、24.07バージョンと比較して、特に以下の点で大幅な改善を提供します:

  • 長いコンテキストの理解
  • 関数呼び出し(Function calling)の精度
  • システムプロンプトの処理

Mistral Large 24.11は、タスクの自動化や意味的なドキュメント理解を含む、エンタープライズRAGおよびエージェント的ワークフロー向けに位置付けられています。これはAPI経由のpixtral-large-latestとして、およびHuggingFaceでのセルフデプロイ用に利用可能です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch