コンテンツにスキップ
メインサイト ニュース コンソール

Meta、Muse Glimmerとともに再登場:ローカル実行・エージェント機能・マルチモーダル対応のオープンソース

· Hugging Face 翻訳済
教程模型卡

オープンソース大規模言語モデル分野の先駆者から、うれしいニュースが届きました!本日、Meta の新しいマルチモーダルモデル Muse Glimmer がリリースされました。特にローカルのエージェント(agentic)アプリケーション向けに設計されています。このモデルは Muse から蒸留されたもので、パラメータ数は 300億(30B)。Apache 2.0 ライセンスで公開されているため、プライバシー保護やコスト削減を目的としたローカル展開はもちろん、単純な探索や開発にも適しています。プログラミング、ドキュメント分析、パーソナルアシスタント、Claw や Hermes のような構成など、プライバシーを重視するユースケースを対象としています。

今回のリリースを記念して、Meta と協力し、transformers、llama.cpp、vLLM、Inference Endpoints などのライブラリやサービスで day-0 サポートを提供します。いくつかの興味深いアプリケーションも構築しました。この記事では、その検証結果を紹介します。

以下のデモを見て、アイデアを膨らませてください。

Muse Glimmer は Hugging Face Hubで入手できます。

ベンチマーク

ベンチマーク結果

スコアはすべて公開済みの結果に基づいています。太字は比較対象モデルの中で最高の結果を示します。↓ は数値が小さいほど優れていることを表します。

カテゴリベンチマークMuse Glimmer-30BGemma4-31B
高推論
Qwen3.6-27B
思考モード
汎用エージェントMCP Atlas75.554.262.5
汎用エージェントDeepSearch QA74.661.771.1
汎用エージェントτ³-Banking23.515.116.7
汎用エージェントWildClawBench47.637.643.2
汎用エージェントGDPval-AA9538111141
汎用エージェントGAIA243.336.440.0
汎用エージェントSkillsBench(スキル使用)44.332.446.6
汎用エージェントOSWorld-Verified65.958.575.6
エージェント型プログラミングSWE-Bench Pro51.236.950.2
エージェント型プログラミングSWE-Bench Verified76.066.677.2
エージェント型プログラミングTerminalBench 2.151.743.460.7
エージェント型プログラミングSciCode43.643.439.8
マルチモーダルCharxiv Reasoning78.877.778.4
マルチモーダルScreenSpot Pro75.475.976.1
マルチモーダルOmniDocBench v1.575.872.577.8
マルチモーダルMMMU Pro747375
安全性CI Memories違反率(↓):26.4
カバレッジ:64.8
違反率(↓):12.1
カバレッジ:53.0
違反率(↓):53.4
カバレッジ:66.9
安全性Siren AgentDojo攻撃成功率(↓):28.4
実用性:94.2
攻撃成功率(↓):25.6
実用性:90.8
攻撃成功率(↓):40.3
実用性:92.7
汎用能力と推論IFBench77.076.070.8
汎用能力と推論AIME 202694.789.294.1
汎用能力と推論GPQA Diamond83.585.784.2
汎用能力と推論Humanity’s Last Exam(テキストのみ、ツールなし)22.023.623.1
汎用能力と推論AA-LCR80.068.373.3
汎用能力と推論Beam 128K65.158.263.0

アーキテクチャ

Muse Glimmer は、以下の要素で構成される密な300億パラメータモデルです。

  • 画像処理用の20億パラメータ ViT 形式エンコーダー(Perception Encoder)
  • 280億パラメータのテキストデコーダー

メインの VLM に加えて、このモデルには DFlash をベースに実装された推測デコード用ドラフターモデル(speculative decoding drafter)も含まれています。このモジュールはオプションで使用でき、一定のメモリコストと引き換えに、生成速度を大幅に向上させられます。このドラフターモデルは、コード生成などの構造化されたコンテンツの生成に特に適していることがわかりました。

テキストデコーダー

この言語モデルには、以下のアーキテクチャコンポーネントが採用されています。

  • ハイブリッドアテンション(Hybrid attention): 3つのスライディングウィンドウ層(ウィンドウサイズは2,048トークン、回転位置埋め込みを使用)と、全アテンションおよび NoPE(位置埋め込みなし)を使用する1つの層を交互に配置しています。つまり、(SWA、SWA、SWA、Full)のパターンを13回繰り返し、合計52層で構成されています。これにより、RoPE によって相対的な順序と距離の情報を保持しながら、NoPE によってグローバルな範囲の情報も保持できます。
  • ゲート付きグループ化クエリアテンション(Gated Grouped-Query Attention): 1つのキー・バリューヘッドを16個のクエリヘッドで共有します。これにより KV キャッシュのメモリ使用量を16分の1に削減し、生成をより高速かつ低コストに実行できます。
  • 追加のクエリスケーリングを伴う Q-K 正規化: アテンションを計算する前に、Muse Glimmer は各クエリヘッドとキーヘッドに RMS 正規化を適用し、アテンションロジットを安定させます。その後、クエリにスケーリング係数を乗算し、正規化後の目標ロジットスケールを設定します。この追加のクエリスケーリングは、softmax の段階では逆温度と同様に機能します。

Perception Encoder

Muse Glimmer は、画像と動画を同じ画像エンコーダーで処理します。他の VLM に搭載されている比較的小規模なビジュアルエンコーダーとは異なり、これは Perception Encoder アーキテクチャをベースに設計された、20億パラメータ規模の大規模な ViT 系モデルです。Meta は以前、Perception Encoder をさまざまな下流の空間タスクおよびマルチモーダルタスクのバックボーンとして紹介しています。

このエンコーダーは、画像を 2フレーム × 3チャンネル × 14 × 14 の形状を持つ画像パッチに分割し、線形層によって射影します。続いて、学習可能な位置テーブルから絶対位置埋め込みを補間し、これらの埋め込みに加算します。その後、埋め込みは50層の GELU MLP で構成されたビジュアルタワーに入力されます。言語モデルと同様に、アテンションパターンは3つのウィンドウアテンション層の後に1つの全アテンション層を配置した構成です。アテンション層内では、クエリとキーに2次元 RoPE を適用します。

Transformer の処理後、ピクセルシャッフル(pixel shuffle)によって隣接する 2×2 の空間トークングループを連結し、チャンネル情報を失うことなく画像トークン数を4分の1に削減します。その後、結合された特徴量をテキストデコーダーの共有埋め込み空間に射影します。

動画はフレームごとに同じエンコーダーで処理され、各フレームは形状 [batch, temporal groups, grid height, grid width, 2 frames, 3 channels, 14, 14] の画像パッチに変換されます。プロセッサーの目標サンプリングレートは毎秒2フレームで、動画クリップは最大96フレームに制限されます。フレームは動画全体から均等にサンプリングされます。プロセッサーはタイムスタンプ付きの動画プレースホルダーを作成し、“Time: 0.0s <|video|> x N” のようにテキストとフレームを交互に配置します。最終的な動画埋め込みは、最終射影層の前に置き換えられます。

Transformers

Muse Glimmer を使用するには、最新バージョンの transformers にアップグレードしてください。

Terminal window
pip install --upgrade transformers accelerate

Muse Glimmer は transformers で day-0 サポートを提供しており、メインモデルと推測デコード用ドラフターモデルの両方に対応しています。AutoModelForMultimodalLM クラスと AutoProcessor クラスを使用して、モデルとプロセッサーを読み込めます。

from transformers import AutoProcessor, AutoModelForMultimodalLM
MODEL_ID = "meta-models/Muse-Glimmer-30B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForMultimodalLM.from_pretrained(
MODEL_ID,
dtype="auto",
device_map="auto"
)

同じコードを変更せずに NVIDIA(CUDA)、AMD(ROCm)、Intel(XPU)の GPU で実行できます。device_map="auto" により、モデルは利用可能なアクセラレーターに読み込まれます。

テキストのみの推論

モデルを読み込んだら、以下のようにテキストのみの推論を実行できます。

from transformers import AutoProcessor, AutoModelForMultimodalLM
MODEL_ID = "meta-models/Muse-Glimmer-30B"
# モデルを読み込む
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForMultimodalLM.from_pretrained(
MODEL_ID,
dtype="auto",
device_map="auto"
)
# プロンプト
messages = [
{"role": "user", "content": "Write a short joke about saving RAM."},
]
# 入力を処理
inputs = processor.apply_chat_template(
messages,
t
#教程#模型卡#Omniapi.co

4All API チームによる投稿

原文リンク:https://huggingface.co/blog/muse-glimmer

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →