Codestral Mamba 發行說明

Mistral AI 推出了 Codestral Mamba,這是一款專為程式碼與推理設計的模型,旨在克服傳統 Transformer 架構的擴展限制。透過採用 Mamba 架構,該模型實現了線性時間推理與理論上的無限序列長度支援,使其在長上下文程式碼生產力任務中極具效率。

Mamba 架構與效能優勢

Codestral Mamba 利用 Mamba 架構,相較於標準的 Transformer 模型提供了顯著的效率提升。主要的技術優勢包括:

  • 線性時間推理: 與 Transformer 不同,Mamba 模型無論輸入長度為何,都能提供更快的回應速度。
  • 無限序列建模: 該架構理論上具備建模無限長度序列的能力。
  • SOTA 性能: 雖然架構有所改變,但 Codestral Mamba 的訓練目標是與當前最尖端(SOTA)的 Transformer 模型在程式碼與推理任務中表現相當。

技術規格與功能

Codestral Mamba 是一款經過指令優化的模型,專為本地部署作為程式碼助理而設計。主要規格包括:

  • 參數數量: 7,285,403,648 個參數。
  • 上下文視窗: 該模型已測試在上下文檢索能力上可支援高達 256k 個 token。
  • 開發: 該模型由 Albert Gu 與 Tri Dao 共同貢獻開發。

部署與可用性

Codestral Mamba 可免費使用、修改與分發,授權條款為 Apache 2.0。使用者可透過多種管道存取與部署此模型:

  • 權重: 原始權重可透過 HuggingFace 下載。
  • SDK: 支援透過 mistral-inference SDK(v1.2.0)與 NVIDIA 的 TensorRT-LLM 進行部署。
  • API 存取: 該模型可在 la Plateforme 上透過識別碼 codestral-mamba-2407 進行測試。
  • 本地推理: 未來預計支援 llama.cpp

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 專案