Codestral Mamba 發行說明
Mistral AI 推出了 Codestral Mamba,這是一款專為程式碼與推理設計的模型,旨在克服傳統 Transformer 架構的擴展限制。透過採用 Mamba 架構,該模型實現了線性時間推理與理論上的無限序列長度支援,使其在長上下文程式碼生產力任務中極具效率。
Mamba 架構與效能優勢
Codestral Mamba 利用 Mamba 架構,相較於標準的 Transformer 模型提供了顯著的效率提升。主要的技術優勢包括:
- 線性時間推理: 與 Transformer 不同,Mamba 模型無論輸入長度為何,都能提供更快的回應速度。
- 無限序列建模: 該架構理論上具備建模無限長度序列的能力。
- SOTA 性能: 雖然架構有所改變,但 Codestral Mamba 的訓練目標是與當前最尖端(SOTA)的 Transformer 模型在程式碼與推理任務中表現相當。
技術規格與功能
Codestral Mamba 是一款經過指令優化的模型,專為本地部署作為程式碼助理而設計。主要規格包括:
- 參數數量: 7,285,403,648 個參數。
- 上下文視窗: 該模型已測試在上下文檢索能力上可支援高達 256k 個 token。
- 開發: 該模型由 Albert Gu 與 Tri Dao 共同貢獻開發。
部署與可用性
Codestral Mamba 可免費使用、修改與分發,授權條款為 Apache 2.0。使用者可透過多種管道存取與部署此模型:
- 權重: 原始權重可透過 HuggingFace 下載。
- SDK: 支援透過
mistral-inferenceSDK(v1.2.0)與 NVIDIA 的 TensorRT-LLM 進行部署。 - API 存取: 該模型可在 la Plateforme 上透過識別碼
codestral-mamba-2407進行測試。 - 本地推理: 未來預計支援
llama.cpp。
Sources
- OriginalCodestral Mamba
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 專案