Llama 3.2 发布说明:多模态视觉与设备端小型语言模型
Meta 已发布 Llama 3.2,这是一套包含十个开源权重模型的集合,提供多模态视觉能力和轻量级、设备端文本模型。此发布将 Llama 生态系统扩展至视觉推理,并实现移动和边缘设备的高效本地执行。
Llama 3.2 Vision:多模态能力
Llama 3.2 Vision 提供视觉理解与推理,支持文档问答、图文检索和视觉定位等任务。模型提供两种规模:用于消费级 GPU 部署的 11B 和用于大规模应用的 90B。两种规模均提供基础版和指令微调版。
技术架构
Llama 3.2 Vision 模型通过将 Llama 3.1 大语言模型与视觉塔和图像适配器相结合构建。具体而言,11B Vision 模型使用 Llama 3.1 8B,90B Vision 模型使用 Llama 3.1 70B。为保持纯文本性能,文本模型在视觉训练过程中保持冻结。
关键规格与性能
- 上下文长度: 128k 令牌,支持带图像的多轮对话。
- 训练数据: 在 60 亿图文对上进行训练。
- 图像处理: 11B 基础模型使用 448 的切片大小,而 90B 及所有指令微调版本使用 560 的切片大小。
- 语言支持: 在纯文本模式下,模型支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语。
视觉基准
| 模型 | MMMU(验证) | VQAv2 | DocVQA | AI2D |
|---|---|---|---|---|
| 11B | 41.7 | 66.8(验证) | 62.3(验证) | 62.4 |
| 11B (Instruct) | 50.7(CoT) | 75.2(测试) | 88.4(测试) | 91.1 |
| 90B | 49.3(零样本) | 73.6(验证) | 70.7(验证) | 75.3 |
| 90B (Instruct) | 60.3(CoT) | 78.1(测试) | 90.1(测试) | 92.3 |
Llama 3.2 1B 与 3B:设备端文本模型
Llama 3.2 推出 1B 与 3B 纯文本模型,专为设备本地执行而设计。这些模型适用于提示改写、摘要、工具使用以及本地运行助手等场景。
性能与训练
这些模型遵循 Llama 3.1 架构,训练数据量最高达 9 万亿令牌。它们保持 128k 令牌的上下文长度,并支持与视觉模型相同的八种语言。
值得注意的是,3B Instruct 模型在 IFEval 基准上表现与 8B 模型相当,使其在需要严格遵循指令的智能体应用中表现出色。
推理内存需求
| 模型规模 | BF16/FP16 | FP8 | INT4 |
|---|---|---|---|
| 3B | 6.5 GB | 3.2 GB | 1.75 GB |
| 1B | 2.5 GB | 1.25 GB | 0.75 GB |
Llama Guard 3:安全与防护
Meta 已发布 Llama Guard 3,用于对模型输入和生成内容进行安全分类。包括:
- 多模态支持: 主 Llama Guard 3 能检测有害的多模态提示或助手响应。
- Llama Guard 3 1B: 一个小型版本,旨在与 1B 与 3B 文本模型一起部署,以评估多轮对话中的响应。该版本允许开发者自定义或排除预定义的安全类别。
部署与生态系统集成
Llama 3.2 已在多个框架中集成,以实现即时部署:
- Hugging Face Transformers: Vision 模型需要 4.45.0 或更高版本。
- 设备端框架:
- Llama.cpp 与 Llama-cpp-python: 支持跨平台 CPU/GPU 推理,使用 4 位和 8 位量化权重。
- Transformers.js: 通过 ONNX 在浏览器或 JavaScript 运行时(Node.js、Deno、Bun)中执行。
- MLC.ai Web-LLM: 使用 WebGPU 提供硬件加速的浏览器内推理。
- 微调: 通过 TRL(Transformer Reinforcement Learning)支持文本和视觉模型的微调,包括通过 PEFT 的 LoRA 微调。
许可限制
Llama 3.2 的许可与 Llama 3.1 类似,但有一项关键例外:居住在欧盟的个人或公司未获授权使用 Llama 3.2 中包含的多模态模型。此限制不适用于使用这些模型的产品的最终用户。