Mistral NeMo 发布说明

Mistral AI 与 NVIDIA 合作发布了 Mistral NeMo,这是一个 12B 参数模型,旨在在其尺寸类别中提供最先进的推理能力、世界知识和编码准确性。由于该模型依赖于标准架构,因此可作为使用 Mistral 7B 系统的即插即用替代方案。

模型架构与性能

Mistral NeMo 是一个 12B 参数模型,支持高达 128k 标记的大上下文窗口。该模型在训练过程中具备量化感知能力,可在不损失性能的情况下实现 FP8 推理。该模型以预训练基础模型和指令微调检查点两种形式提供,采用 Apache 2.0 许可证。

多语言能力与 Tekken 分词器

Mistral NeMo 针对全球应用进行了优化,在英语、法语、德语、西班牙语、意大利语、葡萄牙语、中文、日语、韩语、阿拉伯语和印地语方面表现尤为出色。为实现这一目标,该模型采用了一种名为 Tekken 的新型分词器,基于 Tiktoken 构建。

Tekken 在超过 100 种语言上进行了训练,相比之前 Mistral 模型所使用的 SentencePiece 分词器,具有更优的压缩效率。具体压缩性能提升包括:

  • 源代码与欧洲语言: 源代码、中文、意大利语、法语、德语、西班牙语和俄语的压缩效率提升约 30%。
  • 韩语与阿拉伯语: 压缩效率提升 2 倍至 3 倍。
  • 通用语言能力: 与 Llama 3 分词器相比,Tekken 在约 85% 的语言文本压缩方面表现更优。

指令微调与对齐

Mistral NeMo 经历了高级微调与对齐阶段,在以下方面相比 Mistral 7B 有显著提升:

  • 指令遵循: 更强的精确指令执行能力。
  • 推理能力: 更强的推理能力。
  • 多轮对话: 更好地处理多轮对话。
  • 代码生成: 生成源代码的准确性更高。

可用性与部署

Mistral NeMo 可通过多个渠道供研究人员和企业使用:

  • HuggingFace: 基础模型和基础指令模型的权重均托管于此。
  • Mistral AI 工具: 可使用 mistral-inference 调用该模型,并通过 mistral-finetune 进行适配。
  • la Plateforme:open-mistral-nemo-2407 名称提供。
  • NVIDIA NIM: 该模型已打包为 NVIDIA NIM 推理微服务,可在 ai.nvidia.com 获取。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch