Codestral Mamba 发布说明
Mistral AI 推出了 Codestral Mamba,这是一种专为代码和推理设计的模型,旨在克服传统 Transformer 架构的扩展限制。通过采用 Mamba 架构,该模型实现了线性时间推理和理论上无限序列长度的支持,使其在长上下文代码生产力任务中表现出极高的效率。
Mamba 架构与性能优势
Codestral Mamba 利用 Mamba 架构,在效率上显著优于标准的基于 Transformer 的模型。其主要技术优势包括:
- 线性时间推理: 与 Transformer 不同,Mamba 模型无论输入长度如何,都能实现更快的响应速度。
- 无限序列建模: 该架构理论上具备建模无限长度序列的能力。
- SOTA 性能: 尽管架构发生了转变,Codestral Mamba 在代码和推理任务中的表现仍可与最先进(SOTA)的 Transformer 模型相媲美。
技术规格与功能
Codestral Mamba 是一个经过指令优化的模型,专为本地部署作为代码助手而设计。关键规格包括:
- 参数量: 7,285,403,648 个参数。
- 上下文窗口: 该模型已测试在上下文检索能力上支持高达 256k 个标记。
- 开发: 该模型由 Albert Gu 和 Tri Dao 共同开发。
部署与可用性
Codestral Mamba 可在 Apache 2.0 许可证下免费使用、修改和分发。用户可通过以下多种渠道访问和部署该模型:
- 权重: 原始权重可通过 HuggingFace 下载。
- SDK: 支持通过
mistral-inferenceSDK(v1.2.0)和 NVIDIA 的 TensorRT-LLM 进行部署。 - API 访问: 该模型可在 la Plateforme 平台上通过标识符
codestral-mamba-2407进行测试。 - 本地推理: 未来将支持
llama.cpp。
Sources
- OriginalCodestral Mamba
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 项目