Codestral Mamba 发布说明

Mistral AI 推出了 Codestral Mamba,这是一种专为代码和推理设计的模型,旨在克服传统 Transformer 架构的扩展限制。通过采用 Mamba 架构,该模型实现了线性时间推理和理论上无限序列长度的支持,使其在长上下文代码生产力任务中表现出极高的效率。

Mamba 架构与性能优势

Codestral Mamba 利用 Mamba 架构,在效率上显著优于标准的基于 Transformer 的模型。其主要技术优势包括:

  • 线性时间推理: 与 Transformer 不同,Mamba 模型无论输入长度如何,都能实现更快的响应速度。
  • 无限序列建模: 该架构理论上具备建模无限长度序列的能力。
  • SOTA 性能: 尽管架构发生了转变,Codestral Mamba 在代码和推理任务中的表现仍可与最先进(SOTA)的 Transformer 模型相媲美。

技术规格与功能

Codestral Mamba 是一个经过指令优化的模型,专为本地部署作为代码助手而设计。关键规格包括:

  • 参数量: 7,285,403,648 个参数。
  • 上下文窗口: 该模型已测试在上下文检索能力上支持高达 256k 个标记。
  • 开发: 该模型由 Albert Gu 和 Tri Dao 共同开发。

部署与可用性

Codestral Mamba 可在 Apache 2.0 许可证下免费使用、修改和分发。用户可通过以下多种渠道访问和部署该模型:

  • 权重: 原始权重可通过 HuggingFace 下载。
  • SDK: 支持通过 mistral-inference SDK(v1.2.0)和 NVIDIA 的 TensorRT-LLM 进行部署。
  • API 访问: 该模型可在 la Plateforme 平台上通过标识符 codestral-mamba-2407 进行测试。
  • 本地推理: 未来将支持 llama.cpp

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目