Llama 3.2 发布说明:多模态视觉与设备端小型语言模型

Meta 已发布 Llama 3.2,这是一套包含十个开源权重模型的集合,提供多模态视觉能力和轻量级、设备端文本模型。此发布将 Llama 生态系统扩展至视觉推理,并实现移动和边缘设备的高效本地执行。

Llama 3.2 Vision:多模态能力

Llama 3.2 Vision 提供视觉理解与推理,支持文档问答、图文检索和视觉定位等任务。模型提供两种规模:用于消费级 GPU 部署的 11B 和用于大规模应用的 90B。两种规模均提供基础版和指令微调版。

技术架构

Llama 3.2 Vision 模型通过将 Llama 3.1 大语言模型与视觉塔和图像适配器相结合构建。具体而言,11B Vision 模型使用 Llama 3.1 8B,90B Vision 模型使用 Llama 3.1 70B。为保持纯文本性能,文本模型在视觉训练过程中保持冻结。

关键规格与性能

  • 上下文长度: 128k 令牌,支持带图像的多轮对话。
  • 训练数据: 在 60 亿图文对上进行训练。
  • 图像处理: 11B 基础模型使用 448 的切片大小,而 90B 及所有指令微调版本使用 560 的切片大小。
  • 语言支持: 在纯文本模式下,模型支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语。

视觉基准

模型 MMMU(验证) VQAv2 DocVQA AI2D
11B 41.7 66.8(验证) 62.3(验证) 62.4
11B (Instruct) 50.7(CoT) 75.2(测试) 88.4(测试) 91.1
90B 49.3(零样本) 73.6(验证) 70.7(验证) 75.3
90B (Instruct) 60.3(CoT) 78.1(测试) 90.1(测试) 92.3

Llama 3.2 1B 与 3B:设备端文本模型

Llama 3.2 推出 1B 与 3B 纯文本模型,专为设备本地执行而设计。这些模型适用于提示改写、摘要、工具使用以及本地运行助手等场景。

性能与训练

这些模型遵循 Llama 3.1 架构,训练数据量最高达 9 万亿令牌。它们保持 128k 令牌的上下文长度,并支持与视觉模型相同的八种语言。

值得注意的是,3B Instruct 模型在 IFEval 基准上表现与 8B 模型相当,使其在需要严格遵循指令的智能体应用中表现出色。

推理内存需求

模型规模 BF16/FP16 FP8 INT4
3B 6.5 GB 3.2 GB 1.75 GB
1B 2.5 GB 1.25 GB 0.75 GB

Llama Guard 3:安全与防护

Meta 已发布 Llama Guard 3,用于对模型输入和生成内容进行安全分类。包括:

  • 多模态支持: 主 Llama Guard 3 能检测有害的多模态提示或助手响应。
  • Llama Guard 3 1B: 一个小型版本,旨在与 1B 与 3B 文本模型一起部署,以评估多轮对话中的响应。该版本允许开发者自定义或排除预定义的安全类别。

部署与生态系统集成

Llama 3.2 已在多个框架中集成,以实现即时部署:

  • Hugging Face Transformers: Vision 模型需要 4.45.0 或更高版本。
  • 设备端框架:
    • Llama.cpp 与 Llama-cpp-python: 支持跨平台 CPU/GPU 推理,使用 4 位和 8 位量化权重。
    • Transformers.js: 通过 ONNX 在浏览器或 JavaScript 运行时(Node.js、Deno、Bun)中执行。
    • MLC.ai Web-LLM: 使用 WebGPU 提供硬件加速的浏览器内推理。
  • 微调: 通过 TRL(Transformer Reinforcement Learning)支持文本和视觉模型的微调,包括通过 PEFT 的 LoRA 微调。

许可限制

Llama 3.2 的许可与 Llama 3.1 类似,但有一项关键例外:居住在欧盟的个人或公司未获授权使用 Llama 3.2 中包含的多模态模型。此限制不适用于使用这些模型的产品的最终用户。

Sources