Skip to main content
Zuletzt überprüft: 2026-08-10
Muse Glimmer ist das Open-Weight-Agentenmodell von Meta Superintelligence Labs, veröffentlicht im August 2026 unter Apache 2.0. Es handelt sich um einen dichten 29.6B-Parameter-kausalen Transformer mit einem integrierten 1.8B ViT-G/14-Wahrnehmungsencoder, einem 131,072-Token-Kontextfenster und Text-Plus-Bild-Eingabe. Meta hat es für Always-On-Lokale-Agenten entwickelt: Tool-Aufrufe mit präzisen Schemata, mehrstufiges Reasoning und Retry nach Fehler — auf einer Consumer-GPU oder einem Mac. Die entscheidende Zahl für Self-Hosting ist 18 GB. Das ist der 4-Bit-Download, und genau deshalb passt dieses Modell auf Hardware, die Sie wahrscheinlich bereits besitzen.
Führen Sie dieses Modell bereits aus? Registrieren Sie es bei Tokios, um es als https://api.tokios.com von jedem Client aus zu erreichen.

Muse Glimmer auf einen Blick

Quellen: Metas Ankündigung zu Muse Glimmer und die Modellkarte.
Muse Spark, das Lehrmodell, wurde nicht veröffentlicht. Metas Ankündigung betrifft ausschließlich die Muse Glimmer-Gewichte. Einige Berichterstattung deutet darauf hin, dass Muse Spark 1.2-Gewichte folgen könnten — betrachten Sie dies als unbestätigt, bis Meta ein Repository veröffentlicht.

Varianten und Tags

Ollama veröffentlicht 13-Builds. Die -dflash-Varianten bündeln den Drafter für das spekulative Decodieren, der etwa 2 GB kostet und einen großen Geschwindigkeitszuwinn bringt — siehe DFlash spekulative Decodierung unten. Jeder Tag enthält den vollständigen 131,072-Token-Kontext und akzeptiert Text und Bilder. Metas eigenes GGUF-Repository, meta-models/Muse-Glimmer-30B-GGUF, benennt seine beiden K-Quant-Builds als muse-glimmer-30B-kquant-17gb.gguf (Ziel 24 GB VRAM) und muse-glimmer-30B-kquant-dynamic.gguf (Ziel 32 GB), wobei der Drafter als dflash-kquant.gguf bezeichnet wird. Bestätigen Sie die Größen mit ollama.com/library/muse-glimmer, bevor Sie sich auf eine Variante festlegen — Quantisierungen werden neu zugeschnitten.

Warum Dichte hier wichtig ist

Aktuelle Flaggschiff-Veröffentlichungen sind fast alle Mixture-of-Experts, und MoE hat eine Speicherfalle: Routing aktiviert einen Bruchteil der Parameter pro Token, aber jedes Experten-Weight bleibt resident. Llama 4 Scout aktiviert 17B Parameter und benötigt dennoch ~67 GB, weil der Speicher mit der Gesamtzahl der Parameter skaliert, nicht mit den aktiven. Muse Glimmer ist bei 30B explizit dense, damit das gesamte Modell passt. Die Arithmetik ist unremarkable, was der Punkt ist:
  • 29.6B Parameter × ~0.5 Bytes bei 4-Bit ≈ 15 GB an Gewichten
  • ~18 GB im Auslieferungszustand, sobald der Vision-Encoder, Embeddings und Metadaten enthalten sind
  • Fügen Sie den KV-Cache für Ihren Kontext oben hinzu — siehe KV cache and context
Es gibt keine Offloading-Tier, um drumherum zu planen, und keine Expert-Parallelismus-Topologie, die entworfen werden muss. Wenn Sie 24 GB haben, ist das Modell resident. Siehe memory and offloading für das, was sich ändert, sobald Gewichte über die GPU hinaus auslagern.

Hardware-Eignung

Urteile gehen vom 4-Bit-Build bei einer bescheidenen Kontextlänge aus. Meta berichtet von Tests auf MacBook M4 Max, M5 Max und RTX 5090. Auf einer 24 GB-Karte passt die -dflash-Build, aber der Drafter und ein langer Kontext konkurrieren um denselben Spielraum. Beginnen Sie mit einem bescheidenen Kontext, messen Sie, und erhöhen Sie ihn dann. Zur Größenschätzung siehe welche Modellgröße passt auf Ihre GPU?.

Haben Sie ein Modell ausgewählt? Verbinden Sie es

Ein authentifizierter Endpunkt bei https://api.tokios.com — keine eingehenden Ports, etwa 5 Minuten.

Ausführen — vom Anfänger bis zum Fortgeschrittenen

Lassen Sie -dflash weg, wenn Sie bei den Arbeitsspeicherressourcen knapp sind. Um das GGUF-Repository von Meta direkt statt der Ollama-Bibliothek zu laden:
Lassen Sie Ollama auf seinem Standard-http://127.0.0.1:11434 und erhöhen Sie num_ctx nur so weit wie Ihr freier Arbeitsspeicher es zulässt, von seinem kleinen Standardwert aus. Siehe Ollama-Fernzugriff.

Sampling-Einstellungen

Meta empfiehlt temperature = 1.0, top_p = 0.95 und top_k = 64. Eine Temperatur von 1.0 ist höher als viele lokale Modelle bevorzugen — das Herabsetzen auf den 0.6–0.7-Bereich, der für andere Checkpoints geeignet ist, ist eine häufige Ursache für verschlechterte Ausgabe hier.

DFlash-spezifisches Decoding

DFlash ist ein leichtgewichtiges Begleitmodell, das Blöcke von 16 Token für das Hauptmodell vorschlägt, um sie in einem Durchgang zu verifizieren, anstatt strikt ein Token nach dem anderen zu generieren. Meta berichtet: Was dies bemerkenswert macht, ist die Verpackung, nicht die Neuheit. Speculative Decoding bedeutet normalerweise, ein kompatibles Entwurfsmodell zu beschaffen und die Paarung selbst abzustimmen. Hier wird der Entwurf mit den Gewichten ausgeliefert und die -dflash Ollama-Tags ermöglichen es beim Pull — etwa 2 GB für eine Beschleunigung, für die Sie andernfalls einen Nachmittag mit der Konfiguration verbringen würden. Der Speedup gilt für das Decoding, daher hilft er am meisten, wenn die Ausgabe lang ist: Agentenschleifen, Codegenerierung und erweitertes Reasoning bei high oder xhigh. Bei kurzen Antworten bringt er wenig. Siehe speculative decoding für den Mechanismus und wie Sie den Gewinn auf Ihrer eigenen Hardware messen können.

Fähigkeiten

  • Kontrollierbares Reasoning. Legen Sie die Stärke im System-Prompt mit Reasoning strength: low fest (oder medium, high, xhigh). Höhere Einstellungen verbrauchen mehr Tokens, bevor eine Antwort gegeben wird — erhöhen Sie ihn für schwere Aufgaben, senken Sie ihn für geringere Latenz.
  • Vision. Der Perception-Encoder ist Teil des Modells und kein nachträgliches Add-on, daher funktioniert die Bild-Eingabe bei jeder Build-Variante. Die Ausgabe ist nur Text.
  • Agentic-Einsatz. Meta hat es für die Ende-zu-Ende-Aufgabenerledigung trainiert und bewertet: Planung, Tool-Aufrufe gegen präzise Schemata, Ergebnisprüfung und Wiederherstellung nach Fehlern. Das ist ein anderes Ziel als bei einem allgemeinen Chat-Modell — siehe coding agents with local models.
  • Mehrsprachig. 100+ Sprachen.

Benchmarks

Von Meta angegeben, für ein heute veröffentlichtes Modell. Es gibt noch keine unabhängige Reproduktion — betrachten Sie diese Werte als die Ansprüche des Herstellers, bis Drittbewertungen erscheinen. Meta positioniert Muse Glimmer gegen Gemma 4 31B und Qwen3.6 27B in agenticen, Coding-, Multimodal-, Sicherheits- und Reasoning-Aufgaben — in derselben Größenklasse, also vergleichen Sie sie mit Ihrer eigenen Arbeitslast, bevor Sie wechseln.

Verbinden Sie es mit Tokios

Ein immer aktiver lokaler Agent ist einer, den Sie erreichen möchten, wenn Sie nicht an der Maschine sind, die ihn ausführt. Tokios sitzt nach Ihrer Laufzeit: Es lädt das Modell nicht herunter und ersetzt Ollama nicht.
1

Halten Sie Ihre lokale Laufzeit am Laufen

Starten Sie Muse Glimmer in Ollama, LM Studio, llama.cpp oder vLLM und lassen Sie es an Loopback gebunden.
2

Paaren Sie den Tokios-Connector

Melden Sie sich bei tokios.com/console an, öffnen Sie die Setup-Registerkarte und klicken Sie auf Start pairing, um einen einmaligen Claim-Code (TKS-XXXX-XXXX) zu erhalten. Führen Sie den Installer auf der Maschine aus, die das Modell ausführt:
Windows
macOS
Linux
Dann approve Sie das Gerät auf der Setup- oder Connectors-Registerkarte.
3

Registrieren Sie einen Deployment

Im Models-Tab registrieren Sie die Upstream-Modell-ID (z. B. muse-glimmer:30b-q4_K_M-dflash) unter einem öffentlichen Deployment-Namen wie muse-glimmer. Clients senden den Deployment-Namen im model-Feld, niemals die lokale ID — spätes Re-Quantisieren ändert daher nichts auf Client-Seite.
4

Erstellen Sie einen API-Schlüssel

Klicken Sie im Keys-Tab auf Create key. Kopieren Sie jetzt den sk-tok-…-Schlüssel — er wird nur einmal angezeigt.

Rufen Sie ihn von überall auf

Einschränkungen

  • Benchmarks sind vom Hersteller gemeldet. Meta hat sie am Veröffentlichungstag veröffentlicht. Warten Sie auf unabhängige Bewertungen, bevor Sie die Coding-Scores als abgeschlossen betrachten.
  • 131,072 Tokens sind eine Obergrenze, kein Ziel. Lange Kontexte fügen KV-Cache-Speicher zu den 18 GB Gewichten hinzu, und auf einer 24 GB-Karte ist das genau der Spielraum, den auch der DFlash-Drafter benötigt.
  • Temperatur 1.0 ist die Empfehlung. Übernehmen Sie keine Sampling-Einstellungen von einem anderen lokalen Modell, ohne sie zu testen.
  • Vision und Tool-Aufrufe hängen von Ihrer Runtime ab. Tokios leitet Bildinhalte und Tool-Aufruf-Felder an den Upstream-Endpunkt weiter — es fügt keine Fähigkeiten hinzu, die Ihre Runtime oder Quantisierung nicht unterstützt. Prüfen Sie unterstützte Backends.
  • Apache 2.0 ist eine echte Änderung für Meta. Llama 4 wird unter der Llama 4 Community License mit einer Acceptable-Use-Policy und einer Schwelle für große Produkte ausgeliefert. Muse Glimmer hat weder das noch jenes, aber lesen Sie die Lizenz selbst, bevor Sie darauf aufbauen.

FAQ

18 GB für den 4-Bit-q4_K_M-Build, oder 20 GB mit dem DFlash-Drafter — sodass eine 24-GB-Karte wie eine RTX 3090 oder 4090 sie ausführt, wobei der verbleibende Spielraum für den KV-Cache verwendet wird. Der 8-Bit-Build benötigt 31 GB und BF16 benötigt 57 GB. Die transparente Berechnung: 29.6B Parameter × ~0.5 Bytes bei 4-Bit ≈ 15 GB Gewichte, plus der Vision-Encoder, Embeddings und Overhead.
Ja. Dies ist die Überschrift der Veröffentlichung — ein dichter 30B Agenten-Modell, das vollständig auf einer Consumer-Karte bei 4-Bit resident ist. Verwenden Sie muse-glimmer:30b-q4_K_M bei 18 GB, oder muse-glimmer:30b-q4_K_M-dflash bei 20 GB, wenn Sie den speculative-decoding-Drafter möchten und den Speicher freimachen können.
Die Gewichte sind unter Apache 2.0 veröffentlicht, was permissiv ist und keine Richtlinie zur akzeptablen Nutzung oder einen Schwellenwert für die Benutzeranzahl mit sich bringt. Dies ist eine Abweichung von der Llama Community License, die von Llama 4 verwendet wird. Beachten Sie, dass offene Gewichte und Open Source nicht dasselbe sind — die Trainingsdaten und die Pipeline werden nicht veröffentlicht.
Ein leichtgewichtiger Drafter-Modell, das zusammen mit Muse Glimmer ausgeliefert wird. Es schlägt Blöcke von 16 Token vor, die das Hauptmodell in einem einzigen Durchlauf verifiziert, anstatt Token für Token zu decodieren. Meta berichtet über 3.1x auf einer RTX 5090, 1.8x auf einem M5 Max und 1.5x auf einem M4 Max. Ziehen Sie ein Ollama-Tag, das auf -dflash endet, um es zu erhalten — keine separate Konfiguration erforderlich.
Metas eigene Benchmarks vergleichen es mit Gemma 4 31B und Qwen3.6 27B und bevorzugen Muse Glimmer, aber das sind herstellerseitig durchgeführte Zahlen am Veröffentlichungstag. Alle 3 befinden sich in derselben Größenklasse und laufen auf derselben Hardware, daher ist die praktische Antwort, jeden von ihnen zu bedienen und Ihre tatsächliche Arbeitslast zu testen — siehe Qwen3.6 und Gemma.
Nein. Es ist eine neue Familie von Meta Superintelligence Labs, die aus einem größeren Lehrermodell namens Muse Spark distilliert wurde, mit einer anderen Architektur und einer anderen Lizenz als Llama 4. Die Llama-Linie ist separat und verwendet weiterhin die Llama Community License.
Fügen Sie Reasoning strength: low, medium, high oder xhigh in den Systemprompt ein. Höhere Einstellungen verwenden mehr Tokens für die reasoning vor der Antwort, was sowohl die Qualität bei schwierigen Aufgaben als auch die Latenz erhöht. Dies wird auch über Tokios durchgereicht — legen Sie es in der system-Nachricht Ihres API-Aufrufs fest.
Ja — er ist dafür konzipiert, mit Tool-Aufrufen gegen präzise Schemas und Fehlerwiederherstellung über mehrstufige Workflows hinweg. Ob ein bestimmter Agent funktioniert, hängt davon ab, wie Ihr Runtime-System Tool-Aufrufe bereitstellt; siehe Kompatibilität von Coding-Agenten für die Matrix und Coding-Agenten mit lokalen Modellen für die Einrichtung.

Spekulative Dekodierung

So funktionieren DFlash-ähnliche Drafters und wie Sie den Geschwindigkeitszuwachs selbst messen können.

Coding-Agenten mit lokalen Modellen

Leiten Sie Claude Code, Cline oder Aider auf ein Modell, das Sie selbst hosten.

Was passt zu Ihrer GPU?

Passen Sie die Modellgröße und den Kontext an Ihren VRAM oder Unified Memory an.

Llama 4

Metas Mixture-of-Experts-Linie und warum 17B aktive Parameter immer noch 67 GB benötigen.

Greifen Sie von Ihrem Telefon darauf zu

Verwenden Sie einen dauerhaft aktiven lokalen Agenten, wenn Sie nicht am Rechner sind.

Schnellstart

Pairen Sie einen Connector und registrieren Sie Ihr erstes Modell End-to-End.