Llama 4 Maverick 및 Scout 릴리스 노트

Meta는 Mixture-of-Experts (MoE) 아키텍처를 기반으로 하는 네이티브 멀티모달 대형 언어 모델인 Llama 4 Maverick과 Llama 4 Scout의 출시를 발표했습니다. 이 모델들은 컨텍스트 윈도우 용량, 멀티모달 처리, 그리고 아키텍처 효율성에서 큰 발전을 가져오며, 두 모델 모두 17B 활성 파라미터를 사용합니다.

모델 변형 및 사양

Llama 4는 다양한 배포 규모에 맞춘 두 가지 주요 모델 변형을 도입합니다:

  • Llama 4 Maverick: 약 400B 총 파라미터와 128명의 전문가를 갖춘 고용량 모델로, 17B 활성 파라미터를 사용합니다.
  • Llama 4 Scout: 약 109B 총 파라미터와 16명의 전문가를 갖춘 효율적인 모델로, 17B 활성 파라미터를 사용합니다.

두 모델은 200개 언어에 걸쳐 최대 40조 토큰으로 학습되었으며, 아랍어, 스페인어, 독일어, 힌디어 등을 포함한 12개 언어에 대해 특화된 파인튜닝이 이루어졌습니다. 이들은 네이티브 멀티모달을 위해 초기 융합을 활용하여 텍스트와 이미지 입력을 동시에 처리할 수 있습니다.

아키텍처 혁신

Llama 4는 극한의 컨텍스트 길이를 지원하고 계산 효율성을 향상시키기 위해 여러 새로운 아키텍처 선택을 적용합니다:

iRoPE 아키텍처 및 NoPE 레이어

긴 컨텍스트를 관리하기 위해 Llama 4는 전통적인 Rotary Positional Embeddings (RoPE)와 NoPE (No Positional Encoding) 레이어를 교차 배치하는 iRoPE 아키텍처를 사용합니다. NoPE 레이어는 매 4번째 레이어마다 등장하며, 컨텍스트 전체에 대한 완전 인과 마스크를 사용하여 긴 시퀀스에서도 성능을 유지하는 데 중요합니다.

청크드 어텐션

RoPE 레이어(매 4개 중 3개)에서 Llama 4는 청크드 어텐션을 구현합니다. 청크드 어텐션 길이가 8,192인 이 레이어들은 8K 블록 단위로 컨텍스트를 추적하여 표준 어텐션에 비해 메모리와 연산 요구량을 감소시킵니다.

어텐션 온도 튜닝

매우 긴 시퀀스에서 어텐션 확률 점수가 0에 가까워지는 현상(softmax 함수의 일반적인 문제)을 방지하기 위해 Llama 4는 NoPE 레이어에서 온도 튜닝(스케일된 softmax)을 사용하여 임의의 컨텍스트 길이에 대한 일반화를 향상시킵니다.

추가 기술 향상

  • QK Normalization: Llama 4 Scout은 임베딩 적용 후 RoPE 레이어에서 Query와 Key 상태에 대해 학습 가능한 파라미터가 없는 RMS 정규화를 사용합니다.
  • MoE Interleaving: Scout이 전체 MoE인 반면, Maverick은 MoE와 밀집 레이어를 교차 배치하여 절반의 레이어에만 전문가를 적용합니다.
  • Co-distillation: Maverick은 더 큰 모델인 Llama Behemoth으로부터 동시 증류(co-distillation)되었으며, 학생과 교사 로짓의 가중치를 동적으로 조정하는 손실 함수를 사용합니다.
  • MetaP: 모델들은 MetaP를 활용하여 훈련 예산 및 모델 크기에 걸쳐 하이퍼파라미터를 최적화합니다.

컨텍스트 윈도우 및 성능

Llama 4 모델은 256K 컨텍스트 길이로 사전 학습되었습니다. 인스트럭션 튜닝된 변형은 이 용량을 크게 확장합니다:

모델 인스트럭션 컨텍스트 길이
Scout (16E) 10M
Maverick (128E) 1M
Scout (16E) 아니오 256K
Maverick (128E) 아니오 256K

평가 및 벤치마크

인스트럭션 튜닝된 Llama 4 모델은 추론, 지식, 멀티모달 작업에서 Llama 3.1 405B와 같은 이전 모델보다 우수합니다:

  • Reasoning & Knowledge: Maverick은 MMLU Pro에서 80.5%, GPQA Diamond에서 69.8%를 달성했습니다.
  • Coding: Maverick은 LiveCodeBench (pass@1)에서 43.4% 점수를 받았습니다.
  • Multimodal Reasoning: Maverick은 MMMU에서 73.4%, ChartQA에서 90.0%를 기록했습니다.
  • Image Understanding: Scout은 DocVQA (사전 학습)에서 91.6%, DocVQA 테스트 (인스트럭션 튜닝)에서 94.4%를 기록했습니다.

배포 및 통합

Llama 4는 transformers v4.51.0, Text Generation Inference (TGI), 그리고 Xet 스토리지 백엔드를 통해 Hugging Face 생태계에 통합되었습니다.

  • Quantization: Llama 4 Scout은 실시간 4비트 또는 8비트 양자화를 지원하여 단일 서버급 GPU에 맞출 수 있습니다. Llama 4 Maverick은 BF16 및 FP8 형식으로 제공됩니다.
  • Storage: Xet 스토리지를 사용하면 기본 모델에 대해 약 25% 중복 제거, 파생 모델에 대해 최대 40% 중복 제거를 달성하여 업로드 및 다운로드 속도가 빨라집니다.
  • Licensing: 모델은 맞춤형 Llama 4 Community License Agreement에 따라 출시됩니다.

Sources