Muse Glimmer auf einen Blick
Varianten und Tags
Ollama veröffentlicht 13-Builds. Die-dflash-Varianten bündeln den Drafter für das spekulative Decodieren, der etwa 2 GB kostet und einen großen Geschwindigkeitszuwinn bringt — siehe DFlash spekulative Decodierung unten.
meta-models/Muse-Glimmer-30B-GGUF, benennt seine beiden K-Quant-Builds als muse-glimmer-30B-kquant-17gb.gguf (Ziel 24 GB VRAM) und muse-glimmer-30B-kquant-dynamic.gguf (Ziel 32 GB), wobei der Drafter als dflash-kquant.gguf bezeichnet wird.
Bestätigen Sie die Größen mit ollama.com/library/muse-glimmer, bevor Sie sich auf eine Variante festlegen — Quantisierungen werden neu zugeschnitten.
Warum Dichte hier wichtig ist
Aktuelle Flaggschiff-Veröffentlichungen sind fast alle Mixture-of-Experts, und MoE hat eine Speicherfalle: Routing aktiviert einen Bruchteil der Parameter pro Token, aber jedes Experten-Weight bleibt resident. Llama 4 Scout aktiviert 17B Parameter und benötigt dennoch ~67 GB, weil der Speicher mit der Gesamtzahl der Parameter skaliert, nicht mit den aktiven. Muse Glimmer ist bei 30B explizit dense, damit das gesamte Modell passt. Die Arithmetik ist unremarkable, was der Punkt ist:- 29.6B Parameter × ~0.5 Bytes bei 4-Bit ≈ 15 GB an Gewichten
- ~18 GB im Auslieferungszustand, sobald der Vision-Encoder, Embeddings und Metadaten enthalten sind
- Fügen Sie den KV-Cache für Ihren Kontext oben hinzu — siehe KV cache and context
Hardware-Eignung
Urteile gehen vom 4-Bit-Build bei einer bescheidenen Kontextlänge aus. Meta berichtet von Tests auf MacBook M4 Max, M5 Max und RTX 5090.-dflash-Build, aber der Drafter und ein langer Kontext konkurrieren um denselben Spielraum. Beginnen Sie mit einem bescheidenen Kontext, messen Sie, und erhöhen Sie ihn dann. Zur Größenschätzung siehe welche Modellgröße passt auf Ihre GPU?.
Haben Sie ein Modell ausgewählt? Verbinden Sie es
https://api.tokios.com — keine eingehenden Ports, etwa 5 Minuten.Ausführen — vom Anfänger bis zum Fortgeschrittenen
- Ollama (am einfachsten)
- LM Studio (GUI)
- llama.cpp
- vLLM (GPU-Bereitstellung)
-dflash weg, wenn Sie bei den Arbeitsspeicherressourcen knapp sind. Um das GGUF-Repository von Meta direkt statt der Ollama-Bibliothek zu laden:http://127.0.0.1:11434 und erhöhen Sie num_ctx nur so weit wie Ihr freier Arbeitsspeicher es zulässt, von seinem kleinen Standardwert aus. Siehe Ollama-Fernzugriff.Sampling-Einstellungen
Meta empfiehlttemperature = 1.0, top_p = 0.95 und top_k = 64. Eine Temperatur von 1.0 ist höher als viele lokale Modelle bevorzugen — das Herabsetzen auf den 0.6–0.7-Bereich, der für andere Checkpoints geeignet ist, ist eine häufige Ursache für verschlechterte Ausgabe hier.
DFlash-spezifisches Decoding
DFlash ist ein leichtgewichtiges Begleitmodell, das Blöcke von 16 Token für das Hauptmodell vorschlägt, um sie in einem Durchgang zu verifizieren, anstatt strikt ein Token nach dem anderen zu generieren. Meta berichtet:-dflash Ollama-Tags ermöglichen es beim Pull — etwa 2 GB für eine Beschleunigung, für die Sie andernfalls einen Nachmittag mit der Konfiguration verbringen würden.
Der Speedup gilt für das Decoding, daher hilft er am meisten, wenn die Ausgabe lang ist: Agentenschleifen, Codegenerierung und erweitertes Reasoning bei high oder xhigh. Bei kurzen Antworten bringt er wenig. Siehe speculative decoding für den Mechanismus und wie Sie den Gewinn auf Ihrer eigenen Hardware messen können.
Fähigkeiten
- Kontrollierbares Reasoning. Legen Sie die Stärke im System-Prompt mit
Reasoning strength: lowfest (odermedium,high,xhigh). Höhere Einstellungen verbrauchen mehr Tokens, bevor eine Antwort gegeben wird — erhöhen Sie ihn für schwere Aufgaben, senken Sie ihn für geringere Latenz. - Vision. Der Perception-Encoder ist Teil des Modells und kein nachträgliches Add-on, daher funktioniert die Bild-Eingabe bei jeder Build-Variante. Die Ausgabe ist nur Text.
- Agentic-Einsatz. Meta hat es für die Ende-zu-Ende-Aufgabenerledigung trainiert und bewertet: Planung, Tool-Aufrufe gegen präzise Schemata, Ergebnisprüfung und Wiederherstellung nach Fehlern. Das ist ein anderes Ziel als bei einem allgemeinen Chat-Modell — siehe coding agents with local models.
- Mehrsprachig. 100+ Sprachen.
Benchmarks
Von Meta angegeben, für ein heute veröffentlichtes Modell. Es gibt noch keine unabhängige Reproduktion — betrachten Sie diese Werte als die Ansprüche des Herstellers, bis Drittbewertungen erscheinen.Verbinden Sie es mit Tokios
Ein immer aktiver lokaler Agent ist einer, den Sie erreichen möchten, wenn Sie nicht an der Maschine sind, die ihn ausführt. Tokios sitzt nach Ihrer Laufzeit: Es lädt das Modell nicht herunter und ersetzt Ollama nicht.Halten Sie Ihre lokale Laufzeit am Laufen
Paaren Sie den Tokios-Connector
TKS-XXXX-XXXX) zu erhalten. Führen Sie den Installer auf der Maschine aus, die das Modell ausführt:Registrieren Sie einen Deployment
muse-glimmer:30b-q4_K_M-dflash) unter einem öffentlichen Deployment-Namen wie muse-glimmer. Clients senden den Deployment-Namen im model-Feld, niemals die lokale ID — spätes Re-Quantisieren ändert daher nichts auf Client-Seite.Erstellen Sie einen API-Schlüssel
sk-tok-…-Schlüssel — er wird nur einmal angezeigt.Rufen Sie ihn von überall auf
Einschränkungen
- Benchmarks sind vom Hersteller gemeldet. Meta hat sie am Veröffentlichungstag veröffentlicht. Warten Sie auf unabhängige Bewertungen, bevor Sie die Coding-Scores als abgeschlossen betrachten.
- 131,072 Tokens sind eine Obergrenze, kein Ziel. Lange Kontexte fügen KV-Cache-Speicher zu den 18 GB Gewichten hinzu, und auf einer 24 GB-Karte ist das genau der Spielraum, den auch der DFlash-Drafter benötigt.
- Temperatur 1.0 ist die Empfehlung. Übernehmen Sie keine Sampling-Einstellungen von einem anderen lokalen Modell, ohne sie zu testen.
- Vision und Tool-Aufrufe hängen von Ihrer Runtime ab. Tokios leitet Bildinhalte und Tool-Aufruf-Felder an den Upstream-Endpunkt weiter — es fügt keine Fähigkeiten hinzu, die Ihre Runtime oder Quantisierung nicht unterstützt. Prüfen Sie unterstützte Backends.
- Apache 2.0 ist eine echte Änderung für Meta. Llama 4 wird unter der Llama 4 Community License mit einer Acceptable-Use-Policy und einer Schwelle für große Produkte ausgeliefert. Muse Glimmer hat weder das noch jenes, aber lesen Sie die Lizenz selbst, bevor Sie darauf aufbauen.
FAQ
Wie viel VRAM benötigt Muse Glimmer?
Wie viel VRAM benötigt Muse Glimmer?
q4_K_M-Build, oder 20 GB mit dem DFlash-Drafter — sodass eine 24-GB-Karte wie eine RTX 3090 oder 4090 sie ausführt, wobei der verbleibende Spielraum für den KV-Cache verwendet wird. Der 8-Bit-Build benötigt 31 GB und BF16 benötigt 57 GB. Die transparente Berechnung: 29.6B Parameter × ~0.5 Bytes bei 4-Bit ≈ 15 GB Gewichte, plus der Vision-Encoder, Embeddings und Overhead.Kann Muse Glimmer auf einer 24 GB GPU ausgeführt werden?
Kann Muse Glimmer auf einer 24 GB GPU ausgeführt werden?
muse-glimmer:30b-q4_K_M bei 18 GB, oder muse-glimmer:30b-q4_K_M-dflash bei 20 GB, wenn Sie den speculative-decoding-Drafter möchten und den Speicher freimachen können.Ist Muse Glimmer Open Source?
Ist Muse Glimmer Open Source?
Was ist DFlash?
Was ist DFlash?
-dflash endet, um es zu erhalten — keine separate Konfiguration erforderlich.Ist Muse Glimmer besser als Qwen3.6 oder Gemma 4?
Ist Muse Glimmer besser als Qwen3.6 oder Gemma 4?
Ist Muse Glimmer ein Llama-Modell?
Ist Muse Glimmer ein Llama-Modell?
Wie steuere ich, wie viel Muse Glimmer denkt?
Wie steuere ich, wie viel Muse Glimmer denkt?
Reasoning strength: low, medium, high oder xhigh in den Systemprompt ein. Höhere Einstellungen verwenden mehr Tokens für die reasoning vor der Antwort, was sowohl die Qualität bei schwierigen Aufgaben als auch die Latenz erhöht. Dies wird auch über Tokios durchgereicht — legen Sie es in der system-Nachricht Ihres API-Aufrufs fest.Kann ich Muse Glimmer mit einem Coding-Agenten verwenden?
Kann ich Muse Glimmer mit einem Coding-Agenten verwenden?