Muse Glimmer en un coup d’œil
Variantes et balises
Ollama publie des builds 13. Les variantes-dflash intègrent le drafter de décodage spéculatif, ce qui coûte environ 2 Go et procure un gain de vitesse important — voir DFlash speculative decoding ci-dessous.
meta-models/Muse-Glimmer-30B-GGUF, nomme ses deux versions K-quant muse-glimmer-30B-kquant-17gb.gguf (cible 24 Go de VRAM) et muse-glimmer-30B-kquant-dynamic.gguf (cible 32 Go), avec le drafter comme dflash-kquant.gguf.
Confirmez les tailles sur ollama.com/library/muse-glimmer avant de vous standardiser sur une seule — les quantifications sont recoupées.
Pourquoi la densité est importante ici
Les dernières versions phares sont presque toutes des mélanges d’experts, et le MoE présente un piège mémoire : le routage active une fraction des paramètres par token, mais tous les poids des experts restent en mémoire. Llama 4 Scout active 17B paramètres et nécessite tout de même ~67 Go, car la mémoire évolue avec le nombre total de paramètres, et non avec ceux activés. Muse Glimmer devient dense à 30B précisément pour que le modèle entier tienne. Le calcul est banal, ce qui est le but :- 29.6B paramètres × ~0.5 octets à 4 bits ≈ 15 Go de poids
- ~18 Go tel qu’expédié, une fois l’encodeur visuel, les embeddings et les métadonnées inclus
- Ajoutez le cache KV pour votre contexte en plus — voir Cache KV et contexte
Compatibilité matérielle
Les verdicts supposent la version 4 bits avec une longueur de contexte modeste. Meta rapporte des tests sur MacBook M4 Max, M5 Max et RTX 5090.-dflash tient, mais le drafteur et un contexte long se disputent la même marge de manœuvre. Commencez par un contexte modeste, mesurez, puis augmentez-le. Pour la méthode de dimensionnement, consultez quelle taille de modèle tient sur votre GPU ?.
Vous avez choisi un modèle ? Connectez-le
https://api.tokios.com — aucun port entrant, environ 5 minutes.Exécutez-le — du débutant à l’avancé
- Ollama (le plus simple)
- LM Studio (interface graphique)
- llama.cpp
- vLLM (inférence GPU)
-dflash si vous manquez de mémoire. Pour extraire directement le dépôt GGUF de Meta au lieu d’utiliser la bibliothèque d’Ollama :http://127.0.0.1:11434 par défaut et augmentez num_ctx depuis sa petite valeur par défaut uniquement dans la limite de votre mémoire libre. Consultez accès distant à Ollama.Paramètres d’échantillonnage
Meta recommandetemperature = 1.0, top_p = 0.95 et top_k = 64. Une température de 1.0 est plus élevée que ce que souhaitent de nombreux modèles locaux — l’abaisser à la plage 0.6–0.7 qui convient à d’autres checkpoints est une cause fréquente de dégradation des sorties ici.
Décodage spéculatif DFlash
DFlash est un modèle compagnon léger qui propose des blocs de 16 tokens que le modèle principal vérifie en un seul passage, au lieu de générer strictement un token à la fois. Meta rapporte :-dflash Ollama le permettent lors du pull — environ 2 Go pour une accélération qui vous ferait autrement passer un après-midi à configurer.
Le gain de vitesse concerne le décodage, ce qui profite surtout aux sorties longues : boucles d’agents, génération de code et raisonnement étendu à high ou xhigh. Il a peu d’impact sur les réponses courtes. Consultez le décodage spéculatif pour le mécanisme et la façon de mesurer le gain sur votre propre matériel.
Capacités
- Raisonnement contrôlable. Réglez l’intensité dans le prompt système avec
Reasoning strength: low(oumedium,high,xhigh). Des valeurs plus élevées consomment plus de jetons avant de répondre — augmentez-les pour les tâches difficiles, réduisez-les pour la latence. - Vision. L’encodeur de perception fait partie intégrante du modèle, et non un module ajouté, donc l’entrée d’image fonctionne sur toute compilation. La sortie est uniquement du texte.
- Usage agentique. Meta l’a entraîné et évalué pour l’accomplissement complet de tâches de bout en bout : planification, invocation d’outils selon des schémas précis, vérification des résultats et récupération après échec. Cela correspond à un objectif différent d’un modèle de chat général — voir les agents de codage avec des modèles locaux.
- Multilingue. 100+ langues.
Benchmarks
Résultats rapportés par Meta, sur un modèle publié aujourd’hui. Aucune reproduction indépendante n’existe encore — considérez ces chiffres comme les affirmations du fournisseur jusqu’à l’apparition d’évaluations tierces.Connectez-le avec Tokios
Un agent local toujours actif est celui que vous souhaitez atteindre lorsque vous n’êtes pas sur la machine qui l’exécute. Tokios se situe après votre runtime : il ne télécharge pas le modèle ni ne remplace Ollama.Gardez votre runtime local en cours d'exécution
Associez le connecteur Tokios
TKS-XXXX-XXXX). Exécutez l’installateur sur la machine qui exécute le modèle :Enregistrer un déploiement
muse-glimmer:30b-q4_K_M-dflash) sous un nom de déploiement public comme muse-glimmer. Les clients envoient le nom de déploiement dans le champ model, jamais l’ID local — ainsi, une re-quantification ultérieure ne change rien du côté client.Créer une clé API
sk-tok-… maintenant — elle n’est affichée qu’une seule fois.Appelez-la depuis n’importe où
Réserves
- Les benchmarks sont rapportés par les fournisseurs. Meta les a publiés le jour de la sortie. Attendez des évaluations indépendantes avant de considérer les scores de codage comme définitifs.
- 131,072 tokens est un plafond, pas un objectif. Les contextes longs ajoutent de la mémoire KV-cache en plus des poids de 18 Go, et sur une carte de 24 Go, c’est exactement la marge que le drafter DFlash souhaite également.
- Temperature 1.0 est la recommandation. Ne réutilisez pas les paramètres d’échantillonnage d’un autre modèle local sans tester.
- La vision et les appels d’outils dépendent de votre runtime. Tokios transmet le contenu de l’image et les champs d’appel d’outils vers le point de terminaison amont — il n’ajoute pas de capacités que votre runtime ou votre quantification ne possèdent pas. Consultez les backends pris en charge.
- Apache 2.0 est un changement réel pour Meta. Llama 4 est livré sous la Licence Communautaire Llama 4 avec une politique d’utilisation acceptable et un seuil pour les grands produits. Muse Glimmer n’a ni l’un ni l’autre, mais lisez vous-même la licence avant de vous baser dessus.
FAQ
De combien de VRAM Muse Glimmer a-t-il besoin ?
De combien de VRAM Muse Glimmer a-t-il besoin ?
q4_K_M, ou 20 Go avec le drafter DFlash — ainsi une carte de 24 Go telle qu’une RTX 3090 ou 4090 peut l’exécuter, l’espace libre restant étant dédié au cache KV. La version 8 bits nécessite 31 Go et BF16 nécessite 57 Go. Le calcul transparent : 29.6B paramètres × ~0.5 octets à 4 bits ≈ 15 Go de poids, plus l’encodeur visuel, les embeddings et les frais généraux.Muse Glimmer peut-il fonctionner sur un GPU de 24 Go ?
Muse Glimmer peut-il fonctionner sur un GPU de 24 Go ?
muse-glimmer:30b-q4_K_M à 18 Go, ou muse-glimmer:30b-q4_K_M-dflash à 20 Go si vous souhaitez le drafter de décodage spéculatif et pouvez vous permettre la mémoire.Muse Glimmer est-il open source ?
Muse Glimmer est-il open source ?
Qu'est-ce que DFlash ?
Qu'est-ce que DFlash ?
-dflash pour l’obtenir — aucune configuration séparée nécessaire.Muse Glimmer est-il meilleur que Qwen3.6 ou Gemma 4 ?
Muse Glimmer est-il meilleur que Qwen3.6 ou Gemma 4 ?
Muse Glimmer est-il un modèle Llama ?
Muse Glimmer est-il un modèle Llama ?
Comment contrôler la quantité de réflexion de Muse Glimmer ?
Comment contrôler la quantité de réflexion de Muse Glimmer ?
Puis-je utiliser Muse Glimmer avec un agent de codage ?
Puis-je utiliser Muse Glimmer avec un agent de codage ?
Reasoning strength: low,medium,highouxhighdans le prompt système. Des paramètres plus élevés consomment plus de tokens pour raisonner avant de répondre, ce qui améliore à la fois la qualité sur les tâches complexes et la latence. Cela transite également par Tokios — définissez-le dans le messagesystemde votre appel API.