Mistral Large 2 发布说明 / 更新内容

Mistral AI 发布了 Mistral Large 2,这是一个拥有 1230 亿参数的模型,针对高吞吐量单节点推理和成本效率进行了优化。该模型旨在与 GPT-4o、Claude 3 Opus 和 Llama 3 405B 等领先的前沿模型竞争,特别是在编程、推理和多语言任务方面。

模型架构与部署

Mistral Large 2 是一个拥有 128k 上下文窗口的 123B 参数模型。它专门为单节点推理而设计,使其能够在长上下文应用中保持高吞吐量。

许可与访问

  • 研究与非商业用途:根据 Mistral Research License (MRL-0.1) 提供。
  • 商业用途:自主部署需要 Mistral Commercial License。
  • API 访问:可通过 la Plateforme (作为 mistral-large-2407) 和 le Chat 提供。
  • 云服务商:可通过 Google Cloud Vertex AI (Managed API)、Azure AI Studio、Amazon Bedrock 和 IBM watsonx.ai 提供。

技术性能与基准测试

Mistral Large 2 相比其前代产品表现出显著的改进,并且与其他领先的开源模型相比具有竞争力的性能。

通用知识与推理

在 MMLU 基准测试中,Mistral Large 2 的预训练版本达到了 84.0% 的准确率,在开源模型的性能/成本帕累托前沿 (Pareto front) 上建立了一个新的点。

编程与数学

继 Codestral 22B 和 Codestral Mamba 的开发之后,Mistral Large 2 在训练中使用了高比例的代码数据。它在代码生成和推理任务中的表现与 GPT-4o、Claude 3 Opus 和 Llama 3 405B 持平。

为了减少幻觉,该模型经过微调,使其更加谨慎和敏锐,训练它在缺乏足够信息以提供确定的回答时能够承认这一点。这种对准确性的关注体现在 GSM8K (8-shot) 和 MATH (0-shot, no CoT) 基准测试性能的提升上。

指令遵循与对齐

Mistral Large 2 在遵循精确指令和管理长多轮对话方面表现出剧烈的改进,这可以通过 MT-Bench、Wild Bench 和 Arena Hard 进行衡量。

与某些通过生成冗长回答来提高评分的模型不同,Mistral Large 2 针对简洁性进行了优化。这种设计选择旨在降低推理成本并促进商业应用中的快速交互。

多语言能力与工具使用

Mistral Large 2 通过在大量多语言数据上进行训练,旨在用于全球商业用例。

语言支持

该模型在以下语言中表现出色:

  • English, French, German, Spanish, Italian, Portuguese, Dutch, Russian, Chinese, Japanese, Korean, Arabic, and Hindi.

工具使用与函数调用

该模型配备了增强的检索技能和函数调用能力。它经过训练,可以执行并行和顺序函数调用,使其适用于复杂的商业应用编排。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch