Meta Muse Glimmer 30B リリース
Metaは、Museモデルから蒸留され、Apache 2.0ライセンスの下でリリースされた30Bパラメータのマルチモーダルモデル、Muse Glimmerをリリースしました。ローカルでのエージェント的活用事例向けに特別に設計されたMuse Glimmerは、コーディング、ドキュメント分析、パーソナルアシスタントなどのプライバシーを重視するアプリケーションに最適化されています。
技術アーキテクチャ
Muse Glimmerは、ビジョン用の2B ViTスタイルのPerception Encoderと、28Bパラメータのテキストデコーダーで構成される、高密度な30Bパラメータモデルです。
テキストデコーダーの設計
テキストデコーダーは、グローバルなコンテキストと効率性のバランスをとるために、いくつかの専門的なアーキテクチャ構成要素を利用しています:
- Hybrid Attention: モデルは、rotary position embedding (RoPE) を使用した3つのスライディングウィンドウレイヤー(2,048トークン)の繰り返しパターンと、それに続くフルアテンションおよびNoPE (no positional embedding) を使用した4番目のレイヤーで構成されています。このパターンは、合計52レイヤーにわたって13回繰り返されます。
- Gated Grouped-Query Attention (GQA): 各key-valueヘッドは16個のqueryヘッドによって共有され、KV-cacheのメモリ要件を16分の1に削減します。
- Q-K Normalization: アテンション計算の前に、ロジットを安定させるためにすべてのqueryおよびkeyヘッドにRMS normalizationが適用され、続いてsoftmaxレベルでの逆温度として機能するようにqueryにスケールファクターが適用されます。
Perception Encoder とマルチモーダル処理
2BのViTのようなPerception Encoderは、画像と動画の両方を処理します。画像を2フレーム x 3チャンネル x 14 x 14の形状にパッチ化し、学習済みテーブルから補間された絶対位置埋め込みを適用します。
- Vision Tower: GELU MLPsを備えた50レイヤーで構成され、3つのウィンドウアテンションレイヤーと、2D RoPEを使用した1つのフルアテンションレイヤーのパターンを利用しています。
- Token Reduction: Pixel shuffleにより、隣接する空間トークンの2x2グループを結合し、チャネル情報を失うことなく画像トークン数を4分の1に削減します。
- Video Processing: 動画は、ターゲットとして毎秒2フレームの速度でフレームごとに処理され、最大96フレームまで制限されます。システムは、テキストと動画の埋め込みを交互に配置するために、タイムスタンプ付きのビデオプレースホルダー(例: "Time: 0.0s <|video|>")を使用します。
パフォーマンス・ベンチマーク
Muse Glimmer-30Bは、エージェント的およびマルチモーダルなタスクにおいて強力なパフォーマンスを示しており、特定の推論カテゴリではGemma4-31BやQwen3.6-27Bのような競合モデルを上回ることがよくあります。
| カテゴリ | ベンチマーク | Muse Glimmer-30B | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|---|
| General Agentic | MCP Atlas | 75.5 | 54.2 | 62.5 |
| General Agentic | GAIA2 | 43.3 | 36.4 | 40.0 |
| Agentic Coding | SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| Multimodal | Charxiv Reasoning | 78.8 | 77.7 | 78.4 |
| General Reasoning | AIME 2026 | 94.7 | 89.2 | 94.1 |
| General Reasoning | Beam 128K | 65.1 | 58.2 | 63.0 |
デプロイメントと推論の最適化
Speculative Decoding with DFlash
Muse Glimmerには、軽量なブロック拡散モデルであるDFlashで実装された、オプションのspeculative decoding drafterが含まれています。このdrafterは、1ステップあたり最大15個の将来のトークンを提案することで、特にコードのような構造化されたコンテンツの生成を高速化します。
エコシステム・サポート
このモデルは、主要なライブラリやフレームワークに対するday-0サポートを提供しています:
- Transformers: NVIDIA, AMD, および Intel GPU上で
AutoModelForMultimodalLMとAutoProcessorをサポートしています。 - llama.cpp: キャリブレーション済みquant化モデル(quants)をサポートしています。また、DFlash speculative decodingもサポートしています。
- vLLM: transformers backend経由でサポートされています。
ファインチューニングの要件
ファインチューニングは、TRL (Transformer Reinforcement Learning) を使用して、SFTまたはAsync GRPO経由で行うことができます。ハードウェア要件はワークロードによります:
- Inference/Eval (BF16): 1x 80GB H100。
- LoRA SFT (BF16): 1x 80GB H100 (microbatch 1 および checkpointing を使用)。
- Full SFT (BF16): 8x 80GB H100 を FSDP/ZeRO-3 を使用して実行。
- LoRA GRPO: 1x 80GB H100 (低速) または 8x H100 (rollout 用に 4、training 用に 4)。
エージェント的機能
マルチモーダルおよびコーディングの習熟度により、Muse Glimmerは、自身のインフラストラクチャを管理できる自律的なエージェントとして構成することが可能です。Hugging Face MCP と OpenClaw に接続されている場合、モデルは以下のタスクを実行できます:
- Self-Quantization: Hubで GGUF weights を検索し、ダウンロード、または
llama-quantizeを使用してソースウェイトを変換・量化してローカルで実行。 - Self-Deployment: vLLM を使用して Hugging Face Inference Endpoints に自身をデプロイし、ヘルスチェックを行い、エージェント接続を構成。
- Self-Optimization: 特定のハードウェア(例: Nvidia H100)上で自身のサービングスタックをベンチマークし、トークン/秒の処理能力を最大化するために最適化を反復的にテスト。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch