Mistral NeMo リリースノート

Mistral AI と NVIDIA は、そのサイズクラスにおいて最先端の推論能力、世界知識、およびコード精度を提供することを目的として、120億パラメータのモデルである Mistral NeMo を共同でリリースしました。このモデルは、標準的なアーキテクチャに依存しているため、Mistral 7B を使用しているシステムの即時置き換えが可能です。

モデルアーキテクチャとパフォーマンス

Mistral NeMo は 120億パラメータのモデルで、最大 128,000 トークンの大きなコンテキスト窓をサポートしています。量子化に配慮した学習が行われており、FP8 推論においてもパフォーマンスの低下がありません。このモデルは、Apache 2.0 ライセンスの下で、事前学習済みベースモデルおよびインストラクションチューニング済みチェックポイントの両方で利用可能です。

多言語対応と Tekken トークナイザー

Mistral NeMo はグローバルなアプリケーションに最適化されており、英語、フランス語、ドイツ語、スペイン語、イタリア語、ポルトガル語、中国語、日本語、韓国語、アラビア語、ヒンディー語において特に優れた性能を発揮します。これを実現するために、Tiktoken を基盤とする新しいトークナイザー「Tekken」が採用されています。

Tekken は 100 言語以上で学習されており、従来の Mistral モデルで使用されていた SentencePiece トークナイザーと比較して、優れた圧縮効率を実現しています。具体的な圧縮効率の向上は以下の通りです:

  • ソースコードおよびヨーロッパ言語: ソースコード、中国語、イタリア語、フランス語、ドイツ語、スペイン語、ロシア語において約 30% の圧縮効率の向上。
  • 韓国語およびアラビア語: 2倍から3倍の圧縮効率の向上。
  • 一般言語処理能力: Tekken は、すべての言語の約 85% において Llama 3 トークナイザーと比較して、テキストの圧縮能力が優れています。

インストラクションの微調整と整合性

Mistral NeMo は高度な微調整と整合性の段階を経ており、Mistral 7B と比較して以下の点で顕著な向上を遂げています:

  • インストラクションの遵守: 精密な指示に従う能力が向上。
  • 推論能力: 推論能力が強化。
  • マルチターン会話: マルチターン対話の処理能力が向上。
  • コード生成: ソースコード生成の正確性が向上。

利用可能性和デプロイ

Mistral NeMo は、研究者および企業向けに複数のチャネルから利用可能です:

  • HuggingFace: ベースモデルおよびベースインストラクションモデルの重みがホストされています。
  • Mistral AI Tools: mistral-inferencemistral-finetune を使用してモデルを利用・カスタマイズできます。
  • la Plateforme: open-mistral-nemo-2407 として利用可能です。
  • NVIDIA NIM: ai.nvidia.com で利用可能な NVIDIA NIM 推論マイクロサービスとしてパッケージ化されています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch