Mistral Small 3 リリースノート

Mistral AIは、低レイテンシの生成AIタスク向けに設計された24BパラメータモデルであるMistral Small 3を導入しました。Apache 2.0ライセンスの下でリリースされたこのモデルは、Llama 3.3 70BやQwen 32Bのような大規模なオープンウェイトモデル、およびGPT-4o-miniのようなプロプライエタリなモデルに対する、高効率な代替手段として位置付けられています。

高効率なパフォーマンスとレイテンシ

Mistral Small 3は、ローカルデプロイに適したサイズでパフォーマンスを最大限に引き出すように設計されています。競合モデルよりも少ないレイヤーを使用することで、フォワードパスあたりの必要時間を大幅に削減し、150トークン/秒のレイテンシを実現しています。

主なパフォーマンス指標は以下の通りです:

  • MMLU Accuracy: 81%以上。
  • Speed: 同一ハードウェア上でLlama 3.3 70B Instructよりも3倍以上高速。
  • Efficiency: Mistral AIは、同カテゴリーで最も効率的なモデルであると説明しています。

モデルの機能とトレーニング

Mistral AIは、事前学習済み(pretrained)および指示チューニング済み(instruction-tuned)の両方のチェックポイントをリリースしました。一部の最新の推論モデルとは異なり、Mistral Small 3は強化学習(RL)や合成データを使用してトレーニングされていません。Mistral AIは、このモデルがDeepSeek R1のようなモデルよりもプロダクションパイプラインの初期段階にあることを指摘しており、開発者が蓄積された推論能力を構築するための強力なベースモデルとなることを示唆しています。

想定されるユースケース

Mistral Small 3は、堅牢な指示追従性と、最小限のレイテンシでの言語パフォーマンスを必要とする生成AIタスクの「80%」に最適化されています。推奨されるユースケースは以下の通りです:

  • Conversational Assistance: ほぼリアルタイムのインタラクションを必要とする、応答の速いバーチャルアシスタント。
  • Agentic Workflows: 自動化プロセス向けの低レイテンシな関数呼び出し(function calling)。
  • Domain Specialization: 医療診断、法律相談、テクニカルサポートなどの分野における専門家を作成するためのモデルのファインチューニング。
  • Local Inference: 量子化した場合、単一のRTX 4090または32GB RAMを搭載したMacBookでのプライベートなデプロイ。

現在、顧客によって評価されている業界特有のアプリケーションには、金融サービスにおける不正検知、ヘルスケアにおける顧客のトリアージ、および自動車、ロボット工学、製造セクター向けのオンデバイスのコマンドおよびコントロールが含まれます。

利用可能性とエコシステム

Mistral Small 3は、la Plateforme上の mistral-small-latest または mistral-small-2501 を通じて利用可能です。また、Hugging Face、Ollama、Kaggle、Together AI、Fireworks AI、IBM Watson Xなどのパートナー経由でも利用可能です。NVIDIA NIM、Amazon SageMaker、Groq、Databricks、Snowflakeとの統合も近日中に予定されています。

オープンソースへのコミットメント

Mistral AIは、MRLライセンスモデルから離れ、汎用モデルに対してApache 2.0ライセンスへのコミットメントを新たにしています。これにより、モデルの重みをダウンロードし、ローカルにデプロイし、自由に修正することが可能になります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch