Llama 3.2 發行說明:多模態視覺與裝置端小型語言模型

Meta 已發布 Llama 3.2,這是一組十個開放權重模型,加入了多模態視覺能力以及輕量級、可在裝置端執行的文字模型。此版本將 Llama 生態系擴展至視覺推理,並支援在行動與邊緣裝置上的高效本地執行。

Llama 3.2 Vision:多模態能力

Llama 3.2 Vision 提供視覺理解與推理,支援文件問答、圖文檢索與視覺定位等任務。模型提供兩種規模:11B 用於消費級 GPU 部署,90B 用於大規模應用。兩種規模皆提供基礎版與指令微調版。

技術架構

Llama 3.2 Vision 模型是透過將 Llama 3.1 大語言模型與視覺塔與影像適配器結合而成。具體而言,11B Vision 模型使用 Llama 3.1 8B,90B Vision 模型使用 Llama 3.1 70B。為了維持純文字效能,文字模型在視覺訓練過程中被凍結。

主要規格與效能

  • 上下文長度: 128k 令牌,支援含圖像的多輪對話。
  • 訓練資料: 使用 60 億圖文配對進行訓練。
  • 影像處理: 11B 基礎模型使用 448 的切片大小,90B 以及所有指令微調版本使用 560 的切片大小。
  • 語言支援: 在純文字模式下,模型支援英語、德語、法語、義大利語、葡萄牙語、印地語、西班牙語與泰語。

視覺基準測試

模型 MMMU (val) VQAv2 DocVQA AI2D
11B 41.7 66.8 (val) 62.3 (val) 62.4
11B (Instruct) 50.7 (CoT) 75.2 (test) 88.4 (test) 91.1
90B 49.3 (zero-shot) 73.6 (val) 70.7 (val) 75.3
90B (Instruct) 60.3 (CoT) 78.1 (test) 90.1 (test) 92.3

Llama 3.2 1B 與 3B:裝置端文字模型

Llama 3.2 推出 1B 與 3B 純文字模型,專為在裝置上本地執行而設計。這些模型適用於提示重寫、摘要、工具使用以及本地執行的助理等情境。

效能與訓練

這些模型遵循 Llama 3.1 架構,訓練資料量高達 9 兆令牌。它們保有 128k 令牌的上下文長度,並支援與視覺模型相同的八種語言。

值得注意的是,3B Instruct 模型在 IFEval 基準上表現與 8B 模型相當,使其在需要嚴格遵循指令的代理應用中極具效能。

推論記憶體需求

模型大小 BF16/FP16 FP8 INT4
3B 6.5 GB 3.2 GB 1.75 GB
1B 2.5 GB 1.25 GB 0.75 GB

Llama Guard 3:安全與防護

Meta 已發布 Llama Guard 3,用於對模型輸入與生成內容進行安全分類。包括:

  • 多模態支援: 主 Llama Guard 3 能偵測有害的多模態提示或助理回應。
  • Llama Guard 3 1B: 一個小型版本,設計與 1B 與 3B 文字模型一起部署,以評估多輪對話中的回應。此版本允許開發者自訂或排除預定義的安全類別。

部署與生態系統整合

Llama 3.2 已整合至多個框架,以便立即部署:

  • Hugging Face Transformers: 需要 4.45.0 或更新版本以支援 Vision 模型。
  • 裝置端框架:
    • Llama.cpp 與 Llama-cpp-python: 支援跨平台 CPU/GPU 推論,使用 4 位元與 8 位元量化權重。
    • Transformers.js: 透過 ONNX 在瀏覽器或 JavaScript 執行環境(Node.js、Deno、Bun)中執行。
    • MLC.ai Web-LLM: 使用 WebGPU 提供硬體加速的瀏覽器內推論。
  • 微調: 透過 TRL(Transformer Reinforcement Learning)支援文字與視覺模型的微調,並可使用 PEFT 進行 LoRA 微調。

授權限制

Llama 3.2 採用與 Llama 3.1 類似的授權條款,唯一關鍵例外是:居住於歐盟的個人或公司不被授予使用 Llama 3.2 中多模態模型的授權權利。此限制不適用於將這些模型整合至產品的最終使用者。

Sources