オープンソース大規模言語モデル分野の先駆者から、うれしいニュースが届きました!本日、Meta の新しいマルチモーダルモデル Muse Glimmer がリリースされました。特にローカルのエージェント(agentic)アプリケーション向けに設計されています。このモデルは Muse から蒸留されたもので、パラメータ数は 300億(30B)。Apache 2.0 ライセンスで公開されているため、プライバシー保護やコスト削減を目的としたローカル展開はもちろん、単純な探索や開発にも適しています。プログラミング、ドキュメント分析、パーソナルアシスタント、Claw や Hermes のような構成など、プライバシーを重視するユースケースを対象としています。
今回のリリースを記念して、Meta と協力し、transformers、llama.cpp、vLLM、Inference Endpoints などのライブラリやサービスで day-0 サポートを提供します。いくつかの興味深いアプリケーションも構築しました。この記事では、その検証結果を紹介します。
Muse Glimmer は Hugging Face Hubで入手できます。
ベンチマーク
ベンチマーク結果
スコアはすべて公開済みの結果に基づいています。太字は比較対象モデルの中で最高の結果を示します。↓ は数値が小さいほど優れていることを表します。
| カテゴリ | ベンチマーク | Muse Glimmer-30B | Gemma4-31B 高推論 | Qwen3.6-27B 思考モード |
|---|---|---|---|---|
| 汎用エージェント | MCP Atlas | 75.5 | 54.2 | 62.5 |
| 汎用エージェント | DeepSearch QA | 74.6 | 61.7 | 71.1 |
| 汎用エージェント | τ³-Banking | 23.5 | 15.1 | 16.7 |
| 汎用エージェント | WildClawBench | 47.6 | 37.6 | 43.2 |
| 汎用エージェント | GDPval-AA | 953 | 811 | 1141 |
| 汎用エージェント | GAIA2 | 43.3 | 36.4 | 40.0 |
| 汎用エージェント | SkillsBench(スキル使用) | 44.3 | 32.4 | 46.6 |
| 汎用エージェント | OSWorld-Verified | 65.9 | 58.5 | 75.6 |
| エージェント型プログラミング | SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| エージェント型プログラミング | SWE-Bench Verified | 76.0 | 66.6 | 77.2 |
| エージェント型プログラミング | TerminalBench 2.1 | 51.7 | 43.4 | 60.7 |
| エージェント型プログラミング | SciCode | 43.6 | 43.4 | 39.8 |
| マルチモーダル | Charxiv Reasoning | 78.8 | 77.7 | 78.4 |
| マルチモーダル | ScreenSpot Pro | 75.4 | 75.9 | 76.1 |
| マルチモーダル | OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 |
| マルチモーダル | MMMU Pro | 74 | 73 | 75 |
| 安全性 | CI Memories | 違反率(↓):26.4 カバレッジ:64.8 | 違反率(↓):12.1 カバレッジ:53.0 | 違反率(↓):53.4 カバレッジ:66.9 |
| 安全性 | Siren AgentDojo | 攻撃成功率(↓):28.4 実用性:94.2 | 攻撃成功率(↓):25.6 実用性:90.8 | 攻撃成功率(↓):40.3 実用性:92.7 |
| 汎用能力と推論 | IFBench | 77.0 | 76.0 | 70.8 |
| 汎用能力と推論 | AIME 2026 | 94.7 | 89.2 | 94.1 |
| 汎用能力と推論 | GPQA Diamond | 83.5 | 85.7 | 84.2 |
| 汎用能力と推論 | Humanity’s Last Exam(テキストのみ、ツールなし) | 22.0 | 23.6 | 23.1 |
| 汎用能力と推論 | AA-LCR | 80.0 | 68.3 | 73.3 |
| 汎用能力と推論 | Beam 128K | 65.1 | 58.2 | 63.0 |
アーキテクチャ
Muse Glimmer は、以下の要素で構成される密な300億パラメータモデルです。
- 画像処理用の20億パラメータ ViT 形式エンコーダー(Perception Encoder)
- 280億パラメータのテキストデコーダー
メインの VLM に加えて、このモデルには DFlash をベースに実装された推測デコード用ドラフターモデル(speculative decoding drafter)も含まれています。このモジュールはオプションで使用でき、一定のメモリコストと引き換えに、生成速度を大幅に向上させられます。このドラフターモデルは、コード生成などの構造化されたコンテンツの生成に特に適していることがわかりました。
テキストデコーダー
この言語モデルには、以下のアーキテクチャコンポーネントが採用されています。
- ハイブリッドアテンション(Hybrid attention): 3つのスライディングウィンドウ層(ウィンドウサイズは2,048トークン、回転位置埋め込みを使用)と、全アテンションおよび NoPE(位置埋め込みなし)を使用する1つの層を交互に配置しています。つまり、(SWA、SWA、SWA、Full)のパターンを13回繰り返し、合計52層で構成されています。これにより、RoPE によって相対的な順序と距離の情報を保持しながら、NoPE によってグローバルな範囲の情報も保持できます。
- ゲート付きグループ化クエリアテンション(Gated Grouped-Query Attention): 1つのキー・バリューヘッドを16個のクエリヘッドで共有します。これにより KV キャッシュのメモリ使用量を16分の1に削減し、生成をより高速かつ低コストに実行できます。
- 追加のクエリスケーリングを伴う Q-K 正規化: アテンションを計算する前に、Muse Glimmer は各クエリヘッドとキーヘッドに RMS 正規化を適用し、アテンションロジットを安定させます。その後、クエリにスケーリング係数を乗算し、正規化後の目標ロジットスケールを設定します。この追加のクエリスケーリングは、softmax の段階では逆温度と同様に機能します。
Perception Encoder
Muse Glimmer は、画像と動画を同じ画像エンコーダーで処理します。他の VLM に搭載されている比較的小規模なビジュアルエンコーダーとは異なり、これは Perception Encoder アーキテクチャをベースに設計された、20億パラメータ規模の大規模な ViT 系モデルです。Meta は以前、Perception Encoder をさまざまな下流の空間タスクおよびマルチモーダルタスクのバックボーンとして紹介しています。
このエンコーダーは、画像を 2フレーム × 3チャンネル × 14 × 14 の形状を持つ画像パッチに分割し、線形層によって射影します。続いて、学習可能な位置テーブルから絶対位置埋め込みを補間し、これらの埋め込みに加算します。その後、埋め込みは50層の GELU MLP で構成されたビジュアルタワーに入力されます。言語モデルと同様に、アテンションパターンは3つのウィンドウアテンション層の後に1つの全アテンション層を配置した構成です。アテンション層内では、クエリとキーに2次元 RoPE を適用します。
Transformer の処理後、ピクセルシャッフル(pixel shuffle)によって隣接する 2×2 の空間トークングループを連結し、チャンネル情報を失うことなく画像トークン数を4分の1に削減します。その後、結合された特徴量をテキストデコーダーの共有埋め込み空間に射影します。
動画はフレームごとに同じエンコーダーで処理され、各フレームは形状 [batch, temporal groups, grid height, grid width, 2 frames, 3 channels, 14, 14] の画像パッチに変換されます。プロセッサーの目標サンプリングレートは毎秒2フレームで、動画クリップは最大96フレームに制限されます。フレームは動画全体から均等にサンプリングされます。プロセッサーはタイムスタンプ付きの動画プレースホルダーを作成し、“Time: 0.0s <|video|> x N” のようにテキストとフレームを交互に配置します。最終的な動画埋め込みは、最終射影層の前に置き換えられます。
Transformers
Muse Glimmer を使用するには、最新バージョンの transformers にアップグレードしてください。
pip install --upgrade transformers accelerateMuse Glimmer は transformers で day-0 サポートを提供しており、メインモデルと推測デコード用ドラフターモデルの両方に対応しています。AutoModelForMultimodalLM クラスと AutoProcessor クラスを使用して、モデルとプロセッサーを読み込めます。
from transformers import AutoProcessor, AutoModelForMultimodalLM
MODEL_ID = "meta-models/Muse-Glimmer-30B"
processor = AutoProcessor.from_pretrained(MODEL_ID)model = AutoModelForMultimodalLM.from_pretrained( MODEL_ID, dtype="auto", device_map="auto")同じコードを変更せずに NVIDIA(CUDA)、AMD(ROCm)、Intel(XPU)の GPU で実行できます。device_map="auto" により、モデルは利用可能なアクセラレーターに読み込まれます。
テキストのみの推論
モデルを読み込んだら、以下のようにテキストのみの推論を実行できます。
from transformers import AutoProcessor, AutoModelForMultimodalLM
MODEL_ID = "meta-models/Muse-Glimmer-30B"
# モデルを読み込むprocessor = AutoProcessor.from_pretrained(MODEL_ID)model = AutoModelForMultimodalLM.from_pretrained( MODEL_ID, dtype="auto", device_map="auto")
# プロンプトmessages = [ {"role": "user", "content": "Write a short joke about saving RAM."},]
# 入力を処理inputs = processor.apply_chat_template( messages, t