Mistral 7B 发布说明

Mistral AI 宣布发布 Mistral 7B,这是一个拥有 73 亿参数的语言模型,旨在以较小的规模实现高性能。该模型采用 Apache 2.0 许可证发布,允许无限制使用和部署。

性能基准测试

Mistral 7B 在所有评估基准上均优于 Llama 2 13B,并在许多方面与 Llama 1 34B 相当。在代码和推理方面,其表现被描述为远超这些模型,同时在性能上接近 CodeLlama 7B,且在英语任务中仍保持高水平能力。

根据 Mistral AI 的说法,该模型在推理、理解以及 STEM 推理(MMLU)方面的表现相当于一个超过其三倍大小的 Llama 2 模型。这种效率带来了显著的内存节省和更高的吞吐量。

评估类别

性能在多个主题上进行了衡量:

  • 常识推理:Hellaswag、Winogrande、PIQA、SIQA、OpenbookQA、ARC-Easy、ARC-Challenge 和 CommonsenseQA 的零样本平均值。
  • 世界知识:NaturalQuestions 和 TriviaQA 的五样本平均值。
  • 阅读理解:BoolQ 和 QuAC 的零样本平均值。
  • 数学:8 样本 GSM8K(maj@8)和 4 样本 MATH(maj@4)的平均值。
  • 代码:零样本 Humaneval 和三样本 MBPP 的平均值。
  • 综合结果:五样本 MMLU、三样本 BBH 和三至五样本 AGI Eval(仅限英语多项选择题)。

技术架构

Mistral 7B 实现了两种主要架构特性,以优化推理速度和序列处理能力:

分组查询注意力(GQA)

Mistral 7B 使用分组查询注意力(GQA)来实现更快的推理速度。

滑动窗口注意力(SWA)

滑动窗口注意力(SWA)使模型能够在较低的计算成本下处理更长的序列。在此机制中,每一层关注前 4,096 个隐藏状态,从而实现线性计算成本 O(滑动窗口.seq_len)。

SWA 利用 Transformer 的堆叠层结构,使标记能够访问比窗口大小所暗示的更久远的信息。例如,第 k 层的一个标记会关注第 k-1 层窗口中的标记,而这些标记又关注更早的标记。这实际上扩展了模型注意力的范围。

在实践中,结合对 FlashAttention 和 xFormers 的改进,SWA 使 16k 长度的序列在 4k 窗口下实现了 2 倍的速度提升。此外,固定的注意力跨度允许模型使用旋转缓冲区将缓存限制在滑动窗口大小,从而在不降低质量的前提下,将 8,192 长度序列的推理缓存内存减少一半。

微调与指令遵循

为了展示基础模型的泛化能力,Mistral AI 发布了 Mistral 7B Instruct,该版本在 HuggingFace 上公开的指令数据集上进行了微调。

Mistral 7B Instruct 在 MT-Bench 基准测试中优于所有其他 7B 模型,并与 13B 聊天模型相当。该模型在微调过程中未使用专有数据或特定“技巧”。

Mistral AI 指出,当前的 Instruct 模型尚无内容审核机制,正在寻求社区参与,以开发适用于需要内容审核输出环境的防护机制。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch