Meta Muse Glimmer 30B 출시 노트

Meta introduces Muse Glimmer for local agentic AI

Meta Superintelligence Labs는 "always-on" 로컬 에이전트 워크플로우를 위해 특별히 설계된 300억 개의 파라미터를 가진 Muse Glimmer를 출시했습니다. Apache 2.0 라이선스로 출시된 이 모델은 소비자용 GPU(예: RTX 5090) 또는 Apple Silicon(M4/M5 Max)에서 실행되도록 최적화되어, 클라우드 연결 없이도 로컬 함수 호출(function calling), 코딩 및 LLM-as-a-judge 평가를 가능하게 합니다.

Core Agentic Capabilities

Muse Glimmer는 장기 실행(long-horizon execution) 및 신뢰성에 초점을 맞추어 자율 에이전트의 복잡한 요구 사항을 처리하도록 설계되었습니다. 주요 기능은 다음과 같습니다:

  • End-to-End Task Completion: 이 모델은 SWE-Bench, MCP-Atlas, Β-Bench, 그리고 DeepSearch QA를 포함한 벤치마크에서, 특히 작성, 디버깅 및 다중 턴 요청 해결 분야에서 강력한 성공률을 보여줍니다.
  • Reliable Tool Use and Recovery: Muse Glimmer는 확장된 워크플로우 전반에 걸쳐 정밀한 함수 호출을 지원하며, 도구 호출이 예상치 못한 결과를 반환할 때 중단되는 대신 진단하고 재시도하도록 훈련되었습니다.
  • Multimodal Reasoning: 전용 인지 인코더(perception encoder)를 통해 모델이 텍스트와 이미지가 교차된 데이터를 처리할 수 있어, 에이전트가 스크린샷, 차트, 문서를 해석할 수 있게 합니다.
  • Multi-Step Reasoning: 모델은 복잡한 워크플로우 동안 일관된 계획을 유지하기 위해 장기적인 추론 체인을 형성할 수 있습니다.
  • Broad Compatibility: OpenClaw 및 기타 에이전트 오케스트레이션 패턴과 함께 작동하도록 설계되었으며 100개 이상의 언어를 지원합니다.

Training Methodology

고수준 추론과 로컬 하드웨어의 메모리 제약 사이의 균형을 맞추기 위해, Meta는 3단계 훈련 접근 방식을 활용했습니다:

  1. Pre-Training: 유사한 데이터 믹스를 사용하는 더 큰 Muse Spark 교사 모델로부터의 Logit distillation.
  2. Mid-Training: 더 풍부한 추론 흔적(reasoning traces)과 더 긴 컨텍스트를 특징으로 하는 에이전트 중심 데이터와 유기적 데이터의 통합.
  3. Post-Training: 코딩, 추론 및 에이전트 도메인 전반에 걸친 지도 학습 미세 조정(SFT), on-policy distillation, 및 강화 학습(RL)의 조합.

Local Deployment Optimizations

Meta는 모델이 소비자용 하드웨어에서 원활하게 작동하도록 보장하기 위해 두 가지 주요 기술적 최적화를 구현했습니다:

4-Bit Quantization

전체 정밀도(full precision)에서 30B 모델은 55 GB 이상의 VRAM을 필요로 합니다. Meta는 가중치를 약 4비트 정밀도로 압축하는 양자화 기술(예: K-Quant-17GB)을 제공합니다. 이는 모델 크기를 20 GB 미만으로 줄여, 24 GB 또는 비트 32 GB 메모리 범위 내에서 KV cache, 인지 인코더, 그리고 speculative decoding drafter를 위한 충분한 여유 공간을 남겨둡니다.

Speculative Decoding via DFlash

토큰 단위 생성의 지연 시간을 극복하기 위해, Muse Glimmer는 DFlash 기반의 경량

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch