Meta Muse Glimmer 30B 출시

Meta는 Muse 모델에서 증류된 30B 파라미터 멀티모달 모델인 Muse Glimmer를 Apache 2.0 라이선스로 출시했습니다. 로컬 에이전트 활용 사례를 위해 특별히 설계된 Muse Glimmer는 코딩, 문서 분석, 개인 비서 기능을 포함하여 프라이버시를 중시하는 애플리케이션에 최적화되어 있습니다.

기술 아키텍처

Muse Glimmer는 비전을 위한 2B ViT 스타일의 Perception Encoder와 28B 파라미터 텍스트 디코더로 구성된 밀집(dense) 30B 파라미터 모델입니다.

텍스트 디코더 설계

텍스트 디코더는 전역 문맥과 효율성의 균형을 맞추기 위해 여러 전문화된 아키텍처 구성 요소를 활용합니다:

  • Hybrid Attention: 모델은 rotary position embedding (RoPE)을 사용하는 세 개의 슬라이딩 윈도우 레이어(2,048 토큰) 패턴을 사용하고, 네 번째 레이어는 full attention과 NoPE (no positional embedding)를 사용합니다. 이 패턴은 총 52개 레이어에 걸쳐 13번 반복됩니다.
  • Gated Grouped-Query Attention (GQA): 각 key-value 헤드는 16개의 query 헤드와 공유되어 KV-cache 메모리 요구 사항을 16배 감소시킵니다.
  • Q-K Normalization: attention 계산 전에 모든 query 및 key 헤드에 RMS normalization을 적용하여 로짓(logits)을 안정화하며, 이어서 softmax 레벨에서 역온도(inverse temperature) 역할을 하는 scale factor를 query에 적용합니다.

Perception Encoder 및 멀티모달 처리

2B ViT 스타일의 Perception Encoder는 이미지와 비디오를 모두 처리합니다. 이미지를 2 frames x 3 channels x 14 x 14 형태의 패치로 나누고, 학습된 테이블로부터 보간된(interpolated) 절대 위치 임베딩을 적용합니다.

  • Vision Tower: GELU MLPs를 포함한 50개 레이어로 구성되며, 세 개의 window attention 레이어와 2D RoPE를 사용하는 하나의 full attention 레이어 패턴을 활용합니다.
  • Token Reduction: Pixel shuffle은 인접한 공간적 토큰의 2x2 그룹을 연결하여 채널 정보 손실 없이 이미지 토큰 수를 4배 감소시킵니다.
  • Video Processing: 비디오는 초당 2프레임(2 frames per second)을 목표로 프레임 단위로 처리되며, 최대 96프레임까지 지원됩니다. 시스템은 텍스트와 비디오 임베딩을 교차 배치하기 위해 타임스탬프가 찍힌 비디오 플레이스홀더(예: "Time: 0.0s <|video|>")를 사용합니다.

성능 벤치마크

Muse Glimmer-30B는 에이전트 및 멀티모달 작업에서 강력한 성능을 보여주며, 특정 추론 카테고리에서 Gemma4-31B 및 Qwen3.6-27B와 같은 경쟁 모델을 종종 능가합니다.

Category Benchmark Muse Glimmer-30B Gemma4-31B Qwen3.6-27B
General Agentic MCP Atlas 75.5 54.2 62.5
General Agentic GAIA2 43.3 36.4 40.0
Agentic Coding SWE-Bench Pro 51.2 36.9 50.2
Multimodal Charxiv Reasoning 78.8 77.7 78.4
General Reasoning AIME 2026 94.7 89.2 94.1
General Reasoning Beam 128K 65.1 58.2 63.0

배포 및 추론 최적화

DFlash를 이용한 Speculative Decoding

Muse Glimmer는 경량 블록 확산 모델(block-diffusion model)인 DFlash에서 구현된 선택적 speculative decoding drafter를 포함합니다. 이 drafter는 단계별로 최대 15개의 미래 토큰을 제안함으로써, 특히 코드와 같은 구조화된 콘텐츠의 생성 속도를 높여줍니다.

에코시스템 지원

이 모델은 여러 주요 라이브러리 및 프레임워크에 대해 day-0 지원을 제공합니다:

  • Transformers: NVIDIA, AMD, 및 Intel GPU에서 AutoModelForMultimodalLMAutoProcessor를 지원합니다.
  • llama.cpp: 교정된(calibrated) quants 및 DFlash speculative decoding을 지원합니다.
  • vLLM: transformers backend를 통해 지원됩니다.

미세 조정(Fine-Tuning) 요구 사항

미세 조정은 SFT 또는 Async GRPO를 통해 TRL (Transformer Reinforcement Learning)을 사용하여 수행할 수 있습니다:

  • Inference/Eval (BF16): 1x 80GB H100.
  • LoRA SFT (BF16): 1x 80GB H100 (microbatch 1 및 checkpointing 포함).
  • Full SFT (BF16): FSDP/ZeRO-3를 사용하는 8x 80GB H100.
  • LoRA GRPO: 1x 80GB H100 (느림) 또는 8x H100 (rollout용 4개, training용 4개).

에이전트 기능

멀티모달 및 코딩 숙련도 덕분에 Muse Glimmer는 자신의 인프라를를 관리할 수 있는 자율 에이전트로 구성될 수 있습니다. Hugging Face MCP 및 OpenClaw에 연결되었을 때, 모델은 다음과 같은 작업을 수행할 수 있습니다:

  • Self-Quantization: Hub에서 GGUF 가중치를 검색, 다운로드하거나, llama-quantize를 사용하여 소스 가중치를 변환 및 양자화하여 로컬에서 실행할 수 있습니다.
  • Self-Deployment: vLLM을 사용하여 Hugging Face Inference Endpoints에 스스로를 배포하고, 상태를 확인하고, 에이전트 연결을 구성합니다.
  • Self-Optimization: 특정 하드웨어(예: Nvidia H100)에서 자신의 서빙 스택을 벤치마크하고, 최적화를 반복적으로 테스트하여 tokens/second 처리량을 최대화합니다.

Sources

관련