Codestral Mamba リリースノート

Mistral AI は、従来の Transformer アーキテクチャのスケーリング制限を克服するように設計された、コードおよび推論に特化したモデルである Codestral Mamba を発表しました。Mamba アーキテクチャを活用することで、線形時間の推論と理論的に無限のシーケンス長をサポートすることができ、長文コンテキストのコード生産性タスクにおいて非常に効率的です。

Mamba アーキテクチャとパフォーマンス上の利点

Codestral Mamba は Mamba アーキテクチャを活用し、標準的な Transformer ベースのモデルと比較して大幅な効率性の向上を実現しています。主な技術的利点は以下の通りです:

  • 線形時間の推論: Transformer とは異なり、Mamba モデルは入力長に関係なく高速な応答を可能にします。
  • 無限シーケンスモデリング: アーキテクチャ上、無限長のシーケンスをモデル化する理論的な能力を備えています。
  • SOTA パフォーマンス: アーキテクチャの変更にもかかわらず、Codestral Mamba はコードおよび推論タスクにおいて、最先端(SOTA)の Transformer ベースモデルと同等の性能を発揮するように訓練されています。

技術仕様と機能

Codestral Mamba は、ローカルデプロイ用に最適化されたインストラクションモデルです。主な仕様は以下の通りです:

  • パラメータ数: 7,285,403,648 パラメータ。
  • コンテキストウィンドウ: 256k トークンまで、コンテキスト内検索機能のテストが完了しています。
  • 開発: このモデルは Albert Gu および Tri Dao の貢献をもとに開発されました。

デプロイと利用可能状況

Codestral Mamba は Apache 2.0 ライセンスの下で、無料で使用・改変・配布が可能です。ユーザーは以下のチャネルからモデルにアクセス・デプロイできます:

  • 重み: HuggingFace を通じて、元の重みをダウンロード可能です。
  • SDK: mistral-inference SDK(v1.2.0)および NVIDIA の TensorRT-LLM を通じてデプロイがサポートされています。
  • API アクセス: codestral-mamba-2407 という識別子で、la Plateforme 上でテスト用に利用可能です。
  • ローカル推論: 今後、llama.cpp への対応が予定されています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト