Skip to main content
Dernière vérification : 2026-08-10
Muse Glimmer is Meta Superintelligence Labs’ open-weight agent model, released August 2026 under Apache 2.0. It is a dense 29.6B-parameter causal transformer with a built-in 1.8B ViT-G/14 perception encoder, a 131,072-token context window, and text-plus-image input. Meta built it for always-on local agents: tool calls with precise schemas, multi-step reasoning, and retry after failure — on one consumer GPU or a Mac. Le chiffre important pour l’auto-hébergement est 18 Go. Il s’agit du téléchargement en 4 bits, et c’est pourquoi ce modèle tient dans le matériel que vous possédez probablement déjà.
Vous utilisez déjà ce modèle ? Enregistrez-le auprès de Tokios pour y accéder via https://api.tokios.com depuis n’importe quel client.

Muse Glimmer en un coup d’œil

Sources : l’annonce de Muse Glimmer de Meta et la fiche du modèle.
Muse Spark, le modèle professeur, n’est pas publié. L’annonce de Meta couvre uniquement les poids de Muse Glimmer. Certaines couvertures suggèrent que les poids de Muse Spark 1.2 pourraient suivre — considérez cela comme non confirmé jusqu’à ce que Meta publie un dépôt.

Variantes et balises

Ollama publie des builds 13. Les variantes -dflash intègrent le drafter de décodage spéculatif, ce qui coûte environ 2 Go et procure un gain de vitesse important — voir DFlash speculative decoding ci-dessous. Chaque tag porte le contexte complet de 131,072 tokens et accepte les textes et les images. Le dépôt GGUF de Meta, meta-models/Muse-Glimmer-30B-GGUF, nomme ses deux versions K-quant muse-glimmer-30B-kquant-17gb.gguf (cible 24 Go de VRAM) et muse-glimmer-30B-kquant-dynamic.gguf (cible 32 Go), avec le drafter comme dflash-kquant.gguf. Confirmez les tailles sur ollama.com/library/muse-glimmer avant de vous standardiser sur une seule — les quantifications sont recoupées.

Pourquoi la densité est importante ici

Les dernières versions phares sont presque toutes des mélanges d’experts, et le MoE présente un piège mémoire : le routage active une fraction des paramètres par token, mais tous les poids des experts restent en mémoire. Llama 4 Scout active 17B paramètres et nécessite tout de même ~67 Go, car la mémoire évolue avec le nombre total de paramètres, et non avec ceux activés. Muse Glimmer devient dense à 30B précisément pour que le modèle entier tienne. Le calcul est banal, ce qui est le but :
  • 29.6B paramètres × ~0.5 octets à 4 bits ≈ 15 Go de poids
  • ~18 Go tel qu’expédié, une fois l’encodeur visuel, les embeddings et les métadonnées inclus
  • Ajoutez le cache KV pour votre contexte en plus — voir Cache KV et contexte
Il n’y a pas de niveau de déchargement à planifier ni de topologie de parallélisme d’experts à concevoir. Si vous disposez de 24 Go, le modèle est en mémoire. Consultez mémoire et déchargement pour savoir ce qui change une fois que les poids dépassent la GPU.

Compatibilité matérielle

Les verdicts supposent la version 4 bits avec une longueur de contexte modeste. Meta rapporte des tests sur MacBook M4 Max, M5 Max et RTX 5090. Sur une carte de 24 Go, la build -dflash tient, mais le drafteur et un contexte long se disputent la même marge de manœuvre. Commencez par un contexte modeste, mesurez, puis augmentez-le. Pour la méthode de dimensionnement, consultez quelle taille de modèle tient sur votre GPU ?.

Vous avez choisi un modèle ? Connectez-le

Un point de bout authentifié à https://api.tokios.com — aucun port entrant, environ 5 minutes.

Exécutez-le — du débutant à l’avancé

Retirez -dflash si vous manquez de mémoire. Pour extraire directement le dépôt GGUF de Meta au lieu d’utiliser la bibliothèque d’Ollama :
Laissez Ollama sur son http://127.0.0.1:11434 par défaut et augmentez num_ctx depuis sa petite valeur par défaut uniquement dans la limite de votre mémoire libre. Consultez accès distant à Ollama.

Paramètres d’échantillonnage

Meta recommande temperature = 1.0, top_p = 0.95 et top_k = 64. Une température de 1.0 est plus élevée que ce que souhaitent de nombreux modèles locaux — l’abaisser à la plage 0.6–0.7 qui convient à d’autres checkpoints est une cause fréquente de dégradation des sorties ici.

Décodage spéculatif DFlash

DFlash est un modèle compagnon léger qui propose des blocs de 16 tokens que le modèle principal vérifie en un seul passage, au lieu de générer strictement un token à la fois. Meta rapporte : Ce qui rend cela notable est l’emballage, pas la nouveauté. Le décodage spéculatif implique normalement de sourcing un modèle de rédaction compatible et d’ajuster l’appariement vous-même. Ici, le rédacteur est livré avec les poids et les balises -dflash Ollama le permettent lors du pull — environ 2 Go pour une accélération qui vous ferait autrement passer un après-midi à configurer. Le gain de vitesse concerne le décodage, ce qui profite surtout aux sorties longues : boucles d’agents, génération de code et raisonnement étendu à high ou xhigh. Il a peu d’impact sur les réponses courtes. Consultez le décodage spéculatif pour le mécanisme et la façon de mesurer le gain sur votre propre matériel.

Capacités

  • Raisonnement contrôlable. Réglez l’intensité dans le prompt système avec Reasoning strength: low (ou medium, high, xhigh). Des valeurs plus élevées consomment plus de jetons avant de répondre — augmentez-les pour les tâches difficiles, réduisez-les pour la latence.
  • Vision. L’encodeur de perception fait partie intégrante du modèle, et non un module ajouté, donc l’entrée d’image fonctionne sur toute compilation. La sortie est uniquement du texte.
  • Usage agentique. Meta l’a entraîné et évalué pour l’accomplissement complet de tâches de bout en bout : planification, invocation d’outils selon des schémas précis, vérification des résultats et récupération après échec. Cela correspond à un objectif différent d’un modèle de chat général — voir les agents de codage avec des modèles locaux.
  • Multilingue. 100+ langues.

Benchmarks

Résultats rapportés par Meta, sur un modèle publié aujourd’hui. Aucune reproduction indépendante n’existe encore — considérez ces chiffres comme les affirmations du fournisseur jusqu’à l’apparition d’évaluations tierces. Meta positionne Muse Glimmer contre Gemma 4 31B et Qwen3.6 27B sur les tâches agentic, de codage, multimodales, de sécurité et de raisonnement — dans la même classe de taille, donc comparez-les sur votre propre charge de travail avant de changer.

Connectez-le avec Tokios

Un agent local toujours actif est celui que vous souhaitez atteindre lorsque vous n’êtes pas sur la machine qui l’exécute. Tokios se situe après votre runtime : il ne télécharge pas le modèle ni ne remplace Ollama.
1

Gardez votre runtime local en cours d'exécution

Démarrez Muse Glimmer dans Ollama, LM Studio, llama.cpp ou vLLM et laissez-le lié à loopback.
2

Associez le connecteur Tokios

Connectez-vous à tokios.com/console, ouvrez l’onglet Setup et cliquez sur Start pairing pour obtenir un code de réclamation à usage unique (TKS-XXXX-XXXX). Exécutez l’installateur sur la machine qui exécute le modèle :
Windows
macOS
Linux
Puis approve l’appareil sur l’onglet Setup ou Connectors.
3

Enregistrer un déploiement

Dans l’onglet Models, enregistrez l’ID de modèle amont (par exemple muse-glimmer:30b-q4_K_M-dflash) sous un nom de déploiement public comme muse-glimmer. Les clients envoient le nom de déploiement dans le champ model, jamais l’ID local — ainsi, une re-quantification ultérieure ne change rien du côté client.
4

Créer une clé API

Dans l’onglet Keys, cliquez sur Create key. Copiez la clé sk-tok-… maintenant — elle n’est affichée qu’une seule fois.

Appelez-la depuis n’importe où

Réserves

  • Les benchmarks sont rapportés par les fournisseurs. Meta les a publiés le jour de la sortie. Attendez des évaluations indépendantes avant de considérer les scores de codage comme définitifs.
  • 131,072 tokens est un plafond, pas un objectif. Les contextes longs ajoutent de la mémoire KV-cache en plus des poids de 18 Go, et sur une carte de 24 Go, c’est exactement la marge que le drafter DFlash souhaite également.
  • Temperature 1.0 est la recommandation. Ne réutilisez pas les paramètres d’échantillonnage d’un autre modèle local sans tester.
  • La vision et les appels d’outils dépendent de votre runtime. Tokios transmet le contenu de l’image et les champs d’appel d’outils vers le point de terminaison amont — il n’ajoute pas de capacités que votre runtime ou votre quantification ne possèdent pas. Consultez les backends pris en charge.
  • Apache 2.0 est un changement réel pour Meta. Llama 4 est livré sous la Licence Communautaire Llama 4 avec une politique d’utilisation acceptable et un seuil pour les grands produits. Muse Glimmer n’a ni l’un ni l’autre, mais lisez vous-même la licence avant de vous baser dessus.

FAQ

18 Go pour la version 4 bits de q4_K_M, ou 20 Go avec le drafter DFlash — ainsi une carte de 24 Go telle qu’une RTX 3090 ou 4090 peut l’exécuter, l’espace libre restant étant dédié au cache KV. La version 8 bits nécessite 31 Go et BF16 nécessite 57 Go. Le calcul transparent : 29.6B paramètres × ~0.5 octets à 4 bits ≈ 15 Go de poids, plus l’encodeur visuel, les embeddings et les frais généraux.
Oui. C’est le titre de la version — un modèle d’agent dense de 30B qui réside entièrement sur une carte grand public en 4 bits. Utilisez muse-glimmer:30b-q4_K_M à 18 Go, ou muse-glimmer:30b-q4_K_M-dflash à 20 Go si vous souhaitez le drafter de décodage spéculatif et pouvez vous permettre la mémoire.
Les poids sont publiés sous Apache 2.0, qui est permissif et ne comporte aucune politique d’utilisation acceptable ni seuil de nombre d’utilisateurs. Cela constitue une rupture par rapport à la Llama Community License utilisée par Llama 4. Notez que les poids ouverts et l’open source ne sont pas la même chose — les données d’entraînement et le pipeline ne sont pas publiés.
Un modèle drafter léger qui est livré avec Muse Glimmer. Il propose des blocs de 16 tokens que le modèle principal vérifie en un seul passage, plutôt que de décoder un token à la fois. Meta rapporte 3.1x sur une RTX 5090, 1.8x sur un M5 Max, et 1.5x sur un M4 Max. Téléchargez une balise Ollama se terminant par -dflash pour l’obtenir — aucune configuration séparée nécessaire.
Les propres benchmarks de Meta le comparent à Gemma 4 31B et Qwen3.6 27B et favorisent Muse Glimmer, mais ce sont des chiffres exécutés par le fabricant le jour de la sortie. Tous 3 appartiennent à la même classe de taille et fonctionnent sur le même matériel, donc la réponse pratique est de servir chacun d’eux et de tester votre charge de travail réelle — voir Qwen3.6 et Gemma.
Non. Il s’agit d’une nouvelle famille issue de Meta Superintelligence Labs, distillée à partir d’un modèle professeur plus grand appelé Muse Spark, avec une architecture différente et une licence différente de Llama 4. La gamme Llama est distincte et utilise toujours la Llama Community License.
Placez Reasoning strength: low, medium, high ou xhigh dans le prompt système. Des paramètres plus élevés consomment plus de tokens pour raisonner avant de répondre, ce qui améliore à la fois la qualité sur les tâches complexes et la latence. Cela transite également par Tokios — définissez-le dans le message system de votre appel API.
Oui — il est conçu à cet effet, avec l’appel d’outils contre des schémas précis et la récupération d’échecs dans les workflows multi-étapes. Qu’un agent spécifique fonctionne dépend de la manière dont votre runtime expose les appels d’outils ; consultez compatibilité des agents de codage pour la matrice et agents de codage avec des modèles locaux pour la configuration.

Décodage spéculatif

Comment fonctionnent les drafters de style DFlash et comment mesurer vous-même le gain de vitesse.

Agents de codage avec des modèles locaux

Pointez Claude Code, Cline ou Aider vers un modèle que vous hébergez.

Qu'est-ce qui convient à votre GPU ?

Dimensionnez le modèle et le contexte à votre VRAM ou mémoire unifiée.

Llama 4

La gamme mixture-of-experts de Meta, et pourquoi 17B actif nécessite toujours 67 Go.

Y accéder depuis votre téléphone

Utilisez un agent local toujours actif lorsque vous êtes éloigné de la machine.

Démarrage rapide

Appairez un connecteur et enregistrez votre premier modèle de bout en bout.