Llama 3.2 릴리스 노트: 멀티모달 비전 및 온-디바이스 소형 언어 모델

Llama 3.2 Vision: 멀티모달 기능

Llama 3.2 Vision은 시각적 이해와 추론을 제공하여 문서 질문 응답, 이미지-텍스트 검색, 시각적 그라운딩과 같은 작업을 가능하게 합니다. 모델은 두 가지 크기로 제공됩니다: 11B는 소비자 수준 GPU 배포용이며 90B는 대규모 애플리케이션용입니다. 두 크기 모두 기본 및 지시 튜닝 변형을 제공합니다.

기술 아키텍처

Llama 3.2 Vision 모델은 Llama 3.1 LLM에 비전 타워와 이미지 어댑터를 결합하여 구축됩니다. 구체적으로 11B Vision 모델은 Llama 3.1 8B를 사용하고, 90B Vision 모델은 Llama 3.1 70B를 사용합니다. 텍스트 전용 성능을 유지하기 위해 비전 학습 과정에서 텍스트 모델은 고정되었습니다.

주요 사양 및 성능

  • Context Length: 128k 토큰, 이미지가 포함된 다중 턴 대화를 지원합니다.
  • Training Data: 60억 개의 이미지-텍스트 쌍으로 학습되었습니다.
  • Image Processing: 11B 기본 모델은 타일 크기 448을 사용하고, 90B 및 모든 지시 튜닝 버전은 타일 크기 560을 사용합니다.
  • Language Support: 텍스트 전용 모드에서 모델은 영어, 독일어, 프랑스어, 이탈리아어, 포르투갈어, 힌디어, 스페인어, 태국어를 지원합니다.

비전 벤치마크

모델 MMMU (val) VQAv2 DocVQA AI2D
11B 41.7 66.8 (val) 62.3 (val) 62.4
11B (Instruct) 50.7 (CoT) 75.2 (test) 88.4 (test) 91.1
90B 49.3 (zero-shot) 73.6 (val) 70.7 (val) 75.3
90B (Instruct) 60.3 (CoT) 78.1 (test) 90.1 (test) 92.3

Llama 3.2 1B 및 3B: 온-디바이스 텍스트 모델

Llama 3.2는 장치에서 로컬 실행을 위해 설계된 1B 및 3B 텍스트 전용 모델을 도입합니다. 이 모델은 프롬프트 재작성, 요약, 도구 사용, 로컬 어시스턴트 실행과 같은 사용 사례를 목표로 합니다.

성능 및 학습

이 모델들은 Llama 3.1 아키텍처를 따르며 최대 9조 토큰으로 학습되었습니다. 128k 토큰 컨텍스트 길이를 유지하고 비전 모델과 동일한 8개 언어를 지원합니다.

특히, 3B Instruct 모델은 IFEval 벤치마크에서 8B 모델만큼 강력한 성능을 보여, 엄격한 지시 따름이 필요한 에이전트 애플리케이션에 매우 효과적입니다.

추론을 위한 메모리 요구 사항

모델 크기 BF16/FP16 FP8 INT4
3B 6.5 GB 3.2 GB 1.75 GB
1B 2.5 GB 1.25 GB 0.75 GB

Llama Guard 3: 안전 및 보호

Meta는 안전을 위해 모델 입력 및 생성물을 분류하는 Llama Guard 3를 출시했습니다. 여기에는 다음이 포함됩니다:

  • Multimodal Support: 주요 Llama Guard 3는 유해한 멀티모달 프롬프트 또는 어시스턴트 응답을 감지할 수 있습니다.
  • Llama Guard 3 1B: 1B 및 3B 텍스트 모델과 함께 배포하도록 설계된 작은 버전으로, 다중 턴 대화에서 응답을 평가합니다. 이 버전을 통해 개발자는 사전 정의된 안전 카테고리를 맞춤 설정하거나 제외할 수 있습니다.

배포 및 생태계 통합

Llama 3.2는 즉시 배포를 용이하게 하기 위해 여러 프레임워크에 통합되었습니다:

  • Hugging Face Transformers: Vision 모델을 위해 버전 4.45.0 이상이 필요합니다.
  • On-Device Frameworks:
    • Llama.cpp & Llama-cpp-python: 4비트 및 8비트 양자화 가중치를 사용한 크로스 플랫폼 CPU/GPU 추론을 지원합니다.
    • Transformers.js: ONNX를 통해 브라우저 또는 JavaScript 런타임(Node.js, Deno, Bun)에서 실행을 가능하게 합니다.
    • MLC.ai Web-LLM: WebGPU를 사용한 하드웨어 가속 인-브라우저 추론을 제공합니다.
  • Fine-tuning: 텍스트 및 비전 모델 모두에 대해 TRL(Transformer Reinforcement Learning)으로 지원되며, PEFT를 통한 LoRA 파인튜닝도 포함됩니다.

라이선스 제한

Llama 3.2는 Llama 3.1과 유사한 라이선스를 따르지만, 한 가지 중요한 예외가 있습니다: 유럽 연합에 거주하는 개인이나 기업은 Llama 3.2에 포함된 멀티모달 모델을 사용할 라이선스 권한이 부여되지 않습니다. 이 제한은 해당 모델을 포함한 제품의 최종 사용자에게는 적용되지 않습니다.

Sources