Meta Muse Glimmer 30B リリース

Metaは、Museモデルから蒸留され、Apache 2.0ライセンスの下でリリースされた30Bパラメータのマルチモーダルモデル、Muse Glimmerをリリースしました。ローカルでのエージェント的活用事例向けに特別に設計されたMuse Glimmerは、コーディング、ドキュメント分析、パーソナルアシスタントなどのプライバシーを重視するアプリケーションに最適化されています。

技術アーキテクチャ

Muse Glimmerは、ビジョン用の2B ViTスタイルのPerception Encoderと、28Bパラメータのテキストデコーダーで構成される、高密度な30Bパラメータモデルです。

テキストデコーダーの設計

テキストデコーダーは、グローバルなコンテキストと効率性のバランスをとるために、いくつかの専門的なアーキテクチャ構成要素を利用しています:

  • Hybrid Attention: モデルは、rotary position embedding (RoPE) を使用した3つのスライディングウィンドウレイヤー(2,048トークン)の繰り返しパターンと、それに続くフルアテンションおよびNoPE (no positional embedding) を使用した4番目のレイヤーで構成されています。このパターンは、合計52レイヤーにわたって13回繰り返されます。
  • Gated Grouped-Query Attention (GQA): 各key-valueヘッドは16個のqueryヘッドによって共有され、KV-cacheのメモリ要件を16分の1に削減します。
  • Q-K Normalization: アテンション計算の前に、ロジットを安定させるためにすべてのqueryおよびkeyヘッドにRMS normalizationが適用され、続いてsoftmaxレベルでの逆温度として機能するようにqueryにスケールファクターが適用されます。

Perception Encoder とマルチモーダル処理

2BのViTのようなPerception Encoderは、画像と動画の両方を処理します。画像を2フレーム x 3チャンネル x 14 x 14の形状にパッチ化し、学習済みテーブルから補間された絶対位置埋め込みを適用します。

  • Vision Tower: GELU MLPsを備えた50レイヤーで構成され、3つのウィンドウアテンションレイヤーと、2D RoPEを使用した1つのフルアテンションレイヤーのパターンを利用しています。
  • Token Reduction: Pixel shuffleにより、隣接する空間トークンの2x2グループを結合し、チャネル情報を失うことなく画像トークン数を4分の1に削減します。
  • Video Processing: 動画は、ターゲットとして毎秒2フレームの速度でフレームごとに処理され、最大96フレームまで制限されます。システムは、テキストと動画の埋め込みを交互に配置するために、タイムスタンプ付きのビデオプレースホルダー(例: "Time: 0.0s <|video|>")を使用します。

パフォーマンス・ベンチマーク

Muse Glimmer-30Bは、エージェント的およびマルチモーダルなタスクにおいて強力なパフォーマンスを示しており、特定の推論カテゴリではGemma4-31BやQwen3.6-27Bのような競合モデルを上回ることがよくあります。

カテゴリ ベンチマーク Muse Glimmer-30B Gemma4-31B Qwen3.6-27B
General Agentic MCP Atlas 75.5 54.2 62.5
General Agentic GAIA2 43.3 36.4 40.0
Agentic Coding SWE-Bench Pro 51.2 36.9 50.2
Multimodal Charxiv Reasoning 78.8 77.7 78.4
General Reasoning AIME 2026 94.7 89.2 94.1
General Reasoning Beam 128K 65.1 58.2 63.0

デプロイメントと推論の最適化

Speculative Decoding with DFlash

Muse Glimmerには、軽量なブロック拡散モデルであるDFlashで実装された、オプションのspeculative decoding drafterが含まれています。このdrafterは、1ステップあたり最大15個の将来のトークンを提案することで、特にコードのような構造化されたコンテンツの生成を高速化します。

エコシステム・サポート

このモデルは、主要なライブラリやフレームワークに対するday-0サポートを提供しています:

  • Transformers: NVIDIA, AMD, および Intel GPU上で AutoModelForMultimodalLMAutoProcessor をサポートしています。
  • llama.cpp: キャリブレーション済みquant化モデル(quants)をサポートしています。また、DFlash speculative decodingもサポートしています。
  • vLLM: transformers backend経由でサポートされています。

ファインチューニングの要件

ファインチューニングは、TRL (Transformer Reinforcement Learning) を使用して、SFTまたはAsync GRPO経由で行うことができます。ハードウェア要件はワークロードによります:

  • Inference/Eval (BF16): 1x 80GB H100。
  • LoRA SFT (BF16): 1x 80GB H100 (microbatch 1 および checkpointing を使用)。
  • Full SFT (BF16): 8x 80GB H100 を FSDP/ZeRO-3 を使用して実行。
  • LoRA GRPO: 1x 80GB H100 (低速) または 8x H100 (rollout 用に 4、training 用に 4)。

エージェント的機能

マルチモーダルおよびコーディングの習熟度により、Muse Glimmerは、自身のインフラストラクチャを管理できる自律的なエージェントとして構成することが可能です。Hugging Face MCP と OpenClaw に接続されている場合、モデルは以下のタスクを実行できます:

  • Self-Quantization: Hubで GGUF weights を検索し、ダウンロード、または llama-quantize を使用してソースウェイトを変換・量化してローカルで実行。
  • Self-Deployment: vLLM を使用して Hugging Face Inference Endpoints に自身をデプロイし、ヘルスチェックを行い、エージェント接続を構成。
  • Self-Optimization: 特定のハードウェア(例: Nvidia H100)上で自身のサービングスタックをベンチマークし、トークン/秒の処理能力を最大化するために最適化を反復的にテスト。

Sources

関連