Q4 classes, soit ~67 Go, tandis que celui de Maverick représente ~245 Go. Choisissez le modèle compatible avec votre matériel, puis utilisez le connecteur Tokios pour y accéder depuis n’importe quel client compatible OpenAI ou Anthropic, en tant qu’https://api.tokios.com.
Meta a désormais orienté son développement vers la gamme Muse — Muse Spark à poids fermés et Muse Glimmer 30B à poids libres. Meta n’a pas officiellement mis fin au développement de Llama et les poids restent téléchargeables, mais aucune version Llama 5 n’a encore été annoncée.
Variantes et étiquettes
Toutes les valeurs ci-dessous proviennent de la bibliothèque Ollama et des fiches modèles de Meta sur Hugging Face. Les étiquettes et les tailles évoluent avec l’arrivée de nouvelles quantisations ; vérifiez-les sur ollama.com/library/llama4 avant de retenir un modèle en particulier.
Sources : ollama.com/library/llama4/tags, annonce de Meta concernant Llama 4, meta-llama/Llama-4-Scout-17B-16E-Instruct.
Un troisième modèle, Llama 4 Behemoth (environ 2 billions de paramètres), a été présenté comme modèle pédagogique pour cette famille mais n’a pas été mis à disposition du public. Seuls Scout et Maverick sont téléchargeables.
Pourquoi le chiffre « 17B actifs » nécessite tout de même 67 Go
Le routage MoE active 17B paramètres par jeton, mais le routeur sélectionne à chaque fois un sous-ensemble différent d’experts ; par conséquent, tous les poids des experts doivent rester chargés en mémoire. Le calcul de la consommation mémoire repose sur le nombre total de paramètres, non sur le nombre actif :- Scout : 109B multiplié par ~0.5 octets pour chaque classe
Q4, soit environ 55 Go de poids, et ~67 Go en pratique avec les surcharges - Maverick : 400B multiplié par ~0.5 octets, soit environ 200 Go de poids, et ~245 Go en pratique
Compatibilité matérielle
Une utilisation confortable avec une longueur de contexte modérée, soit environQ4 Go. Chaque valeur indiquée est une estimation ; la valeur réelle correspond à la taille du fichier téléchargé plus la mémoire du cache KV pour votre contexte. Les chiffres annoncés pour les modèles à contexte long (10M Go pour Scout) multiplient la consommation du cache KV bien au-delà de ce que la plupart des machines peuvent supporter. Consultez quel modèle convient à votre GPU ? pour les calculs de dimensionnement.
Mettez-le en service depuis un seul point d’accès une fois lancé
Enregistrez votre déploiement Llama 4 auprès de Tokios puis appelez-le depuis n’importe quelle machine disposant d’une clé API
sk-tok-… ; il n’est pas nécessaire d’ouvrir de ports entrants sur l’ordinateur hébergeant les GPU.Mise en œuvre adaptée aux débutants comme aux experts
- Ollama (le plus simple)
- vLLM (multi-GPU)
http://127.0.0.1:11434 par défaut. Augmentez la valeur de num_ctx au-delà de la valeur par défaut d’Ollama afin d’utiliser un contexte plus long, mais calculez cette taille en fonction de la mémoire libre disponible et non selon la valeur indiquée en titre pour 10M.Capacités
- Saisie multimodale : Scout et Maverick acceptent nativement le texte ainsi que les images ; la sortie reste cependant uniquement textuelle.
- Contexte : Scout propose une fenêtre de 10M tokens tandis que Maverick en gère 1M. Travailler avec des longueurs proches de ces valeurs engendre des problèmes de mémoire liés au cache KV ; consultez Cache KV et contexte avant de planifier votre déploiement.
- Langues : Les fiches de modèles de Meta indiquent qu’12 langues sont prises en charge, parmi lesquelles l’anglais, l’allemand, le français, l’espagnol, le portugais, l’hindi et le vietnamien.
- Raisonnement : Il s’agit de modèles génériques entraînés sur des instructions ; aucun mode de raisonnement séparé n’est disponible. Pour obtenir des réponses détaillées étape par étape, privilégiez DeepSeek ou gpt-oss.
Connectez-le à Tokios
1
Maintenez votre environnement d’exécution local actif
Lancez Llama 4 via Ollama, vLLM ou tout autre runtime compatible OpenAI, puis laissez-le associé à l’adresse de boucle locale.
2
Associez le connecteur Tokios
Connectez-vous à tokios.com/console, ouvrez l’onglet Setup puis cliquez sur Start pairing afin d’obtenir un code d’activation unique (Ensuite, sélectionnez approve le périphérique dans l’onglet Setup ou Connectors.
TKS-XXXX-XXXX). Exécutez ensuite l’installateur sur la machine hébergeant le modèle :Windows
macOS
Linux
3
Enregistrer un déploiement
Dans l’onglet Models, indiquez l’ID de modèle amont (par exemple
llama4:scout) sous un nom de déploiement public tel que llama4-tunnel. Les clients renseignent ce nom de déploiement dans le champ model, et non l’identifiant local.4
Créer une clé API et l’utiliser
Dans l’onglet Keys, cliquez sur Create key, puis :
Points de vigilance
- Aucune prise en charge pour les GPU grand public. Contrairement à la gamme 3.x, aucun modèle Llama 4 ne tient sur une carte graphique de 24 à 48 Go de VRAM. Les environnements d’exécution basés sur llama.cpp peuvent transférer les experts vers la mémoire système, mais le débit chute fortement dès que les poids quittent le GPU. Prévoyez une mémoire unifiée ou un serveur si vous comptez utiliser Llama 4 en production.
- License: Llama 4 uses Meta’s Llama 4 Community License — not Apache or MIT. It carries an acceptable-use policy and a separate Meta license requirement for products above 700 million monthly active users. Check it before commercial use.
- Un contexte étendu représente un coût mémoire, pas une fonctionnalité gratuite. Une fenêtre de 10M tokens à pleine capacité nécessite une mémoire cache KV bien supérieure à la taille des poids du modèle. Adaptez les paramètres
num_ctxet--max-model-lenen fonction de la quantité de mémoire disponible. - Tokios transmet simplement le contenu d’image et les champs d’appel d’outil à l’environnement d’exécution amont ; il n’ajoute aucune fonctionnalité non prise en charge par cet environnement ou par le processus de quantification.
Muse Glimmer
La gamme actuelle de modèles à poids ouverts de Meta : licence Apache 2.0, conçus pour l’usage d’agents, et compatibles avec une carte de 24 Go.
Quel connecteur convient à votre GPU ?
Déterminez la taille du modèle en fonction de votre VRAM ou de votre mémoire unifiée avant de procéder au téléchargement.
Quantification et matériel
Quels formats de poids peuvent être exécutés sur votre GPU, Mac ou système doté de mémoire unifiée ?
Démarrage rapide
Associez un connecteur et enregistrez votre premier modèle dans un processus complet.