Mistral NeMo 发布说明
Mistral AI 与 NVIDIA 合作发布了 Mistral NeMo,这是一个 12B 参数模型,旨在在其尺寸类别中提供最先进的推理能力、世界知识和编码准确性。由于该模型依赖于标准架构,因此可作为使用 Mistral 7B 系统的即插即用替代方案。
模型架构与性能
Mistral NeMo 是一个 12B 参数模型,支持高达 128k 标记的大上下文窗口。该模型在训练过程中具备量化感知能力,可在不损失性能的情况下实现 FP8 推理。该模型以预训练基础模型和指令微调检查点两种形式提供,采用 Apache 2.0 许可证。
多语言能力与 Tekken 分词器
Mistral NeMo 针对全球应用进行了优化,在英语、法语、德语、西班牙语、意大利语、葡萄牙语、中文、日语、韩语、阿拉伯语和印地语方面表现尤为出色。为实现这一目标,该模型采用了一种名为 Tekken 的新型分词器,基于 Tiktoken 构建。
Tekken 在超过 100 种语言上进行了训练,相比之前 Mistral 模型所使用的 SentencePiece 分词器,具有更优的压缩效率。具体压缩性能提升包括:
- 源代码与欧洲语言: 源代码、中文、意大利语、法语、德语、西班牙语和俄语的压缩效率提升约 30%。
- 韩语与阿拉伯语: 压缩效率提升 2 倍至 3 倍。
- 通用语言能力: 与 Llama 3 分词器相比,Tekken 在约 85% 的语言文本压缩方面表现更优。
指令微调与对齐
Mistral NeMo 经历了高级微调与对齐阶段,在以下方面相比 Mistral 7B 有显著提升:
- 指令遵循: 更强的精确指令执行能力。
- 推理能力: 更强的推理能力。
- 多轮对话: 更好地处理多轮对话。
- 代码生成: 生成源代码的准确性更高。
可用性与部署
Mistral NeMo 可通过多个渠道供研究人员和企业使用:
- HuggingFace: 基础模型和基础指令模型的权重均托管于此。
- Mistral AI 工具: 可使用
mistral-inference调用该模型,并通过mistral-finetune进行适配。 - la Plateforme: 以
open-mistral-nemo-2407名称提供。 - NVIDIA NIM: 该模型已打包为 NVIDIA NIM 推理微服务,可在 ai.nvidia.com 获取。
Sources
- OriginalMistral NeMo
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch