Skip to main content
最終確認日:2026-08-10
Muse Glimmer is Meta Superintelligence Labs’ open-weight agent model, released August 2026 under Apache 2.0. It is a dense 29.6B-parameter causal transformer with a built-in 1.8B ViT-G/14 perception encoder, a 131,072-token context window, and text-plus-image input. Meta built it for always-on local agents: tool calls with precise schemas, multi-step reasoning, and retry after failure — on one consumer GPU or a Mac. セルフホスティングにおいて重要なのは 18 GB です。これは 4 ビットのダウンロードであり、このモデルがたぶんすでに所有しているハードウェアに収まる理由です。
このモデルをすでに実行していますか? Tokios への登録 を行って、あらゆるクライアントから https://api.tokios.com としてアクセスしてください。

Muse Glimmer の概要

出典: Meta の Muse Glimmer 発表 および モデルカード。
教師モデルの Muse Spark はリリースされていません。 Meta の発表では Muse Glimmer のウェイトのみがカバーされています。いくつかの報道では Muse Spark 1.2 のウェイトが後続する可能性があることが示唆されていますが、Meta がリポジトリを公開するまでこれを未確認として扱ってください。

変種とタグ

Ollama は 13 ビルドを公開しています。 -dflash 変種には推測デコーディングのドラフターがバンドルされており、約 2 GB のコストで大幅な高速化を実現します — 以下の DFlash 推測デコーディング を参照してください。 Every tag carries the full 131,072-token context and accepts text and images. Meta’s own GGUF repo, meta-models/Muse-Glimmer-30B-GGUF, names its two K-quant builds muse-glimmer-30B-kquant-17gb.gguf (targets 24 GB VRAM) and muse-glimmer-30B-kquant-dynamic.gguf (targets 32 GB), with the drafter as dflash-kquant.gguf. Confirm sizes against ollama.com/library/muse-glimmer before you standardize on one — quantizations get re-cut.

ここで密集型が重要な理由

最新のフラッグシップリリースのほとんどはすべてMixture-of-Expertsであり、MoEにはメモリトラップがあります。ルーティングはトークンごとにパラメーターの断片をアクティブにしますが、すべてのエキスパートの重みは常駐し続けます。Llama 4 Scout は 17B パラメーターをアクティブにしますが、メモリはアクティブなパラメーターではなく総パラメーター数でスケールするため、依然として約 67 GB 必要です。 Muse Glimmer は 30B でデンスに設計されており、モデル全体が収まるようにしています。この算術は特筆すべきものではなく、それがポイントです。
  • 29.6B パラメーター × ~0.5 バイト at 4-bit ≈ 15 GB の重み
  • ビジョンエンコーダー、埋め込み、およびメタデータを含めると、出荷時のサイズは約 18 GB です。
  • Add KV cache for your context on top — see KV cache and context
計画するためのオフローディングティアも、設計するためのエキスパート並列性トポロジーもありません。24 GB あれば、モデルは常駐します。重みがGPUを越えて溢れた場合に何が変わるかは、memory and offloading を参照してください。

ハードウェア適合性

判定は、 modest なコンテキスト長での 4 ビルドを前提としています。Meta は MacBook M4 Max、M5 Max、および RTX 5090 でのテストを報告しています。 On a 24 GB card the -dflash build fits, but the drafter and a long context compete for the same headroom. Start at a modest context, measure, then raise it. For the sizing method, see what size model fits your GPU?.

モデルを選びましたか? コネクターに接続してください

One authenticated endpoint at https://api.tokios.com — no inbound ports, about 5 minutes.

実行する — 初心者から上級者まで

メモリが限られている場合は -dflash をドロップしてください。Ollamaのライブラリビルドではなく、MetaのGGUFリポジトリを直接取得する場合:
Ollamaをデフォルトの http://127.0.0.1:11434 のままにし、空きメモリが許す範囲でだけ num_ctx を小さなデフォルト値から引き上げてください。Ollamaのリモートアクセス を参照してください。

サンプリング設定

Meta は temperature = 1.0、top_p = 0.95、および top_k = 64 を推奨しています。1.0 の温度は、多くのローカルモデルが求める値よりも高いです — 他のチェックポイントに適した 0.6–0.7 の範囲に下げることは、ここで出力が劣化する一般的な原因です。

DFlash 推測デコーディング

DFlash は、メインモデルが一度のパスで検証するために 16 トークンのブロックを提案する軽量なコンパニオンモデルです。Meta の報告: これが目立つ理由は、新規性ではなくパッケージングにあります。推測デコーディングは通常、互換性のあるドラフトモデルを調達し、ペアリングを自分で調整することを意味します。ここではドラフターが重みと一緒に同梱され、-dflash Ollama タグがプル時にそれを有効にします — それ otherwise 午後を構成するのに費やすであろう速度向上のために、約 2 GB です。 高速化はデコーディングを対象としているため、エージェントのループ、コード生成、high または xhigh における長時間の推論など、出力が長い場面で最も効果的です。短めの回答ではほとんど効果がありません。仕組みやご自身のハードウェアでの効果の測定方法については、speculative decoding を参照してください。

機能

  • 制御可能な推論。 システムプロンプトで Reasoning strength: low(または medium、high、xhigh)の強度を設定します。高い設定は回答前により多くのトークンを消費します — 難しいタスクでは高く、レイテンシを重視する場合は低く設定してください。
  • ビジョン。 知覚エンコーダーはモデルの一部であり、後付けのモジュールではないため、どのビルドでも画像入力が利用可能です。出力はテキストのみです。
  • エージェント利用。 Meta はエンドツーエンドのタスク完了のためにこれをトレーニングおよび評価しました。これには、計画策定、正確なスキーマに対するツール呼び出し、結果の検証、および失敗からの回復が含まれます。これは汎用チャットモデルとは異なるターゲットです。ローカルモデルによるコーディングエージェントについては、coding agents with local models を参照してください。
  • 多言語。 100 以上の言語。

ベンチマーク

Meta が報告した、本日リリースされたモデルに基づくデータです。独立した再現はまだ存在しません。第三者による評価が現れるまでは、これらをベンダーの主張として扱ってください。 Meta は Muse Glimmer を Gemma 4 31B および Qwen3.6 27B に対して、エージェント型、コーディング、マルチモーダル、安全性、推論の各タスクで位置付けます — 同一のサイズクラスなので、切り替える前に自身のワークロードで比較してください。

Tokios で接続する

常時稼働するローカルエージェントとは、そのモデルを実行しているマシンにいない時にアクセスしたいエージェントのことです。Tokios はランタイムの後に位置し、モデルをダウンロードしたり Ollama を置き換えたりするものではありません。
1

ローカルランタイムを稼働状態に保つ

Ollama、LM Studio、llama.cpp、または vLLM で Muse Glimmer を起動し、ループバックにバインドしたままにします。
2

Tokios コネクターをペアリングする

Sign in at tokios.com/console, open the Setup tab, and click Start pairing to get a one-time claim code (TKS-XXXX-XXXX). Run the installer on the machine that runs the model:
Windows
macOS
Linux
次に、approve を Setup または Connectors タブ上のデバイスに接続します。
3

デプロイを登録する

In the Models tab, register the upstream model id (for example muse-glimmer:30b-q4_K_M-dflash) under a public deployment name like muse-glimmer. Clients send the deployment name in the model field, never the local id — so re-quantizing later changes nothing on the client side.
4

APIキーを作成する

In the Keys tab, click Create key. Copy the sk-tok-… key now — it is shown only once.

どこからでも呼び出す

注意事項

  • ベンチマークはベンダーが報告したものです。 Meta はリリース日にそれらを公開しました。コーディングスコアが決着したとみなす前に、独立した評価を待ってください。
  • 131,072 トークンは目標ではなく上限です。 長いコンテキストは、18 GB の重みに加えて KV キャッシュメモリを追加し、24 GB のカードでは、それが DFlash ドラフターが求めるまさに余裕です。
  • Temperature 1.0 が推奨です。 テストせずに他のローカルモデルからサンプリング設定を引き継がないでください。
  • ビジョンとツール呼び出しはランタイムに依存します。 Tokios は画像コンテンツとツール呼び出しフィールドをアップストリームエンドポイントに渡しますが、ランタイムや量子化に欠けている機能を追加しません。サポートされているバックエンド を確認してください。
  • Apache 2.0 は Meta にとって実質的な変更です。 Llama 4 は、許容使用ポリシーと大規模プロダクトの閾値を備えた Llama 4 コミュニティライセンスの下で出荷されます。Muse Glimmer にはそれらはありませんが、それの上に構築する前にライセンスを自分で読んでください。

よくある質問

18 GB for the 4-bit q4_K_M build, or 20 GB with the DFlash drafter — so a 24 GB card such as an RTX 3090 or 4090 runs it, with the remaining headroom going to KV cache. The 8-bit build needs 31 GB and BF16 needs 57 GB. The transparent calculation: 29.6B parameters × ~0.5 bytes at 4-bit ≈ 15 GB of weights, plus the vision encoder, embeddings, and overhead.
Yes. This is the headline for the release — a dense 30B agent model that is fully resident on one consumer card at 4-bit. Use muse-glimmer:30b-q4_K_M at 18 GB, or muse-glimmer:30b-q4_K_M-dflash at 20 GB if you want the speculative-decoding drafter and can spare the memory.
重みは Apache 2.0 の下で公開されており、これは寛容なライセンスで、利用規約やユーザー数の閾値がありません。これは Llama 4 が使用する Llama Community License とは異なります。オープン重みとオープンソースは同じ意味ではないことに注意してください — 学習データとパイプラインは公開されていません。
A lightweight drafter model that ships alongside Muse Glimmer. It proposes blocks of 16 tokens which the main model verifies in a single pass, rather than decoding one token at a time. Meta reports 3.1x on an RTX 5090, 1.8x on an M5 Max, and 1.5x on an M4 Max. Pull an Ollama tag ending in -dflash to get it — no separate configuration.
Meta 自身のベンチマークでは Gemma 4 31B および Qwen3.6 27B と比較され Muse Glimmer が優れているとされていますが、これらはリリース当日にベンダーが実行した数値です。すべて 3 は同じサイズ クラスに属し、同じハードウェアで実行されるため、実用的な答えはそれぞれをサーブして実際のワークロードをテストすることです — Qwen3.6 と Gemma を参照してください。
いいえ。これは Meta Superintelligence Labs の新しいファミリーで、Muse Spark というより大きな教師モデルから蒸留され、Llama 4 とは異なるアーキテクチャとライセンスを持っています。Llama シリーズは別個のもので、引き続き Llama Community License を使用しています。
システムプロンプトに Reasoning strength: low, medium, high, または xhigh を設定します。高い設定は回答前により多くのトークンで推論に費やし、複雑なタスクでの品質とレイテンシーの両方を向上させます。これは Tokios にも適用されるため、API コールの system メッセージで設定してください。
はい — 正確なスキーマに対するツール呼び出しと、マルチステップワークフロー全体での障害回復のために構築されています。特定のエージェントが動作するかどうかは、ランタイムがツール呼び出しをどのように公開するかによります。マトリックスについては コーディングエージェントの互換性 を、セットアップについては ローカルモデルでのコーディングエージェント を参照してください。

推測的デコーディング

DFlash 形式のドラフターがどのように動作し、どのようにしてスピードアップを測定するか。

ローカルモデルでのコーディングエージェント

Claude Code、Cline、または Aider を、あなたがホストするモデルに向けて設定します。

あなたの GPU に適しているのはどれ?

VRAM またはユニファイドメモリに合わせてモデルサイズとコンテキストを調整します。

Llama 4

Meta の混合Expertsライン、そして 17B アクティブでもなぜ 67 GB 必要なのか。

スマホからアクセスする

マシンから離れているときは、常時稼働するローカルエージェントを使用してください。

クイックスタート

コネクターをペアリングし、エンドツーエンドで最初のモデルを登録します。