Codestral Mamba リリースノート
Mistral AI は、従来の Transformer アーキテクチャのスケーリング制限を克服するように設計された、コードおよび推論に特化したモデルである Codestral Mamba を発表しました。Mamba アーキテクチャを活用することで、線形時間の推論と理論的に無限のシーケンス長をサポートすることができ、長文コンテキストのコード生産性タスクにおいて非常に効率的です。
Mamba アーキテクチャとパフォーマンス上の利点
Codestral Mamba は Mamba アーキテクチャを活用し、標準的な Transformer ベースのモデルと比較して大幅な効率性の向上を実現しています。主な技術的利点は以下の通りです:
- 線形時間の推論: Transformer とは異なり、Mamba モデルは入力長に関係なく高速な応答を可能にします。
- 無限シーケンスモデリング: アーキテクチャ上、無限長のシーケンスをモデル化する理論的な能力を備えています。
- SOTA パフォーマンス: アーキテクチャの変更にもかかわらず、Codestral Mamba はコードおよび推論タスクにおいて、最先端(SOTA)の Transformer ベースモデルと同等の性能を発揮するように訓練されています。
技術仕様と機能
Codestral Mamba は、ローカルデプロイ用に最適化されたインストラクションモデルです。主な仕様は以下の通りです:
- パラメータ数: 7,285,403,648 パラメータ。
- コンテキストウィンドウ: 256k トークンまで、コンテキスト内検索機能のテストが完了しています。
- 開発: このモデルは Albert Gu および Tri Dao の貢献をもとに開発されました。
デプロイと利用可能状況
Codestral Mamba は Apache 2.0 ライセンスの下で、無料で使用・改変・配布が可能です。ユーザーは以下のチャネルからモデルにアクセス・デプロイできます:
- 重み: HuggingFace を通じて、元の重みをダウンロード可能です。
- SDK:
mistral-inferenceSDK(v1.2.0)および NVIDIA の TensorRT-LLM を通じてデプロイがサポートされています。 - API アクセス:
codestral-mamba-2407という識別子で、la Plateforme 上でテスト用に利用可能です。 - ローカル推論: 今後、
llama.cppへの対応が予定されています。
Sources
- OriginalCodestral Mamba
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- プロジェクト