Q4-Klasse-Download ist ~67 GB, Maverick’s ist ~245 GB. Führen Sie das aus, das zu Ihrer Hardware passt, und koppeln Sie dann den Tokios-Connector, um es als https://api.tokios.com von jedem OpenAI- oder Anthropic-kompatiblen Client zu erreichen.
Metas Modellentwicklung hat sich auf die Muse-Linie verlagert — das Closed-Weight Muse Spark und das Open-Weight Muse Glimmer 30B. Meta hat Llama nicht offiziell eingestellt, und die Gewichte sind weiterhin herunterladbar, aber es wurde kein Llama 5 angekündigt.
Varianten & Tags
Jeder untenstehende Wert stammt aus der Ollama-Bibliothek und den Hugging Face-Modellkarten von Meta. Tags und Größen ändern sich, wenn neue Quantisierungen veröffentlicht werden — bestätigen Sie dies vor der Standardisierung auf einen Tag mit ollama.com/library/llama4.
Quellen: ollama.com/library/llama4/tags, Metas Llama 4 Ankündigung, meta-llama/Llama-4-Scout-17B-16E-Instruct.
Ein drittes Modell, Llama 4 Behemoth (~2T Parameter), wurde als Lehrermodell für die Familie vorgestellt, ist jedoch nicht öffentlich verfügbar. Nur Scout und Maverick sind herunterladbar.
Warum “17B aktiv” immer noch 67 GB benötigt
MoE-Routing aktiviert 17B Parameter pro Token, aber der Router wählt für jedes Token eine andere Teilmenge von Experten aus — daher müssen alle Experten-Gewichte geladen bleiben. Die Speicherberechnung wird durch die Gesamtzahl der Parameter bestimmt, nicht durch die aktiven:- Scout: 109B × ~0.5 Bytes bei
Q4-Klasse ≈ 55 GB Gewichte, ~67 GB wie ausgeliefert mit Overhead - Maverick: 400B × ~0.5 Bytes ≈ 200 GB Gewichte, ~245 GB wie ausgeliefert
Hardware-Eignung
Komfortabel bei etwaQ4 mit einer moderaten Kontextlänge. Betrachten Sie jeden Eintrag als Schätzung — die Wahrheit ist die tatsächliche Download-Größe plus KV-Cache für Ihren Kontext, und die Langkontext-Kopfnummern (10M für Scout) multiplizieren den KV-Cache-Speicher weit über das hinaus, was die meisten Maschinen halten. Siehe Welche Modellgröße passt auf Ihre GPU? für die Größenberechnung.
Stellen Sie es nach dem Start über einen einzigen Endpunkt bereit
Registrieren Sie Ihre Llama 4-Deployment bei Tokios und rufen Sie sie von jedem Rechner mit einem
sk-tok-…-Schlüssel auf — keine eingehenden Ports auf dem Rechner mit den GPUs.Ausführen — vom Anfänger bis zum Fortgeschrittenen
- Ollama (am einfachsten)
- vLLM (Multi-GPU)
http://127.0.0.1:11434 lauschen. Erhöhen Sie num_ctx über Ollamas kleines Standardlimit hinaus, um den langen Kontext zu nutzen — dimensionieren Sie es jedoch nach Ihrem freien Arbeitsspeicher und nicht nach der 10M-Kopffläche.Fähigkeiten
- Multimodale Eingabe: Scout und Maverick akzeptieren nativ Text und Bilder; die Ausgabe ist nur Text.
- Kontext: Scout wirbt mit einem 10M-Token-Fenster und Maverick mit 1M. Das Serving in der Nähe dieser Längen ist ein eigenes KV-Cache-Speicherproblem — siehe KV-Cache und Kontext, bevor Sie darauf basierend planen.
- Sprachen: Die Modellkarten von Meta listen 12 unterstützte Sprachen auf, darunter Englisch, Deutsch, Französisch, Spanisch, Portugiesisch, Hindi und Vietnamesisch.
- Reasoning: Allgemeine, mit Anweisungen abgestimmte Modelle — kein separater Denkmodus. Für schrittweise Reasoning-Ausgaben siehe DeepSeek oder gpt-oss.
Verbinden Sie es mit Tokios
1
Halten Sie Ihre lokale Laufzeit am Laufen
Starten Sie Llama 4 in Ollama, vLLM oder einer anderen OpenAI-kompatiblen Laufzeit und lassen Sie es an Loopback gebunden.
2
Paaren Sie den Tokios-Connector
Melden Sie sich bei tokios.com/console an, öffnen Sie die Setup-Registerkarte und klicken Sie auf Start pairing, um einen einmaligen Claim-Code (Dann approve das Gerät auf der Setup- oder Connectors-Registerkarte.
TKS-XXXX-XXXX) zu erhalten. Führen Sie den Installer auf dem Computer aus, auf dem das Modell läuft:Windows
macOS
Linux
3
Eine Deployment registrieren
Tragen Sie im Models-Tab die Upstream-Modell-ID (z. B.
llama4:scout) unter einem öffentlichen Deployment-Namen wie llama4-tunnel ein. Clients senden den Deployment-Namen im model-Feld, niemals die lokale ID.4
Einen API-Schlüssel erstellen und benennen
Klicken Sie im Keys-Tab auf Create key, dann:
Hinweise
- Kein Consumer-GPU-Pfad. Im Gegensatz zur 3.x-Reihe passt weder das Llama 4-Modell mit 24–48 GB VRAM auf eine Karte. llama.cpp-basierte Runtimes können Experten auf den Systemspeicher auslagern, aber der Durchsatz sinkt stark, sobald Gewichte die GPU verlassen — planen Sie Unified Memory oder einen Server ein, bevor Sie sich auf Llama 4 festlegen.
- Lizenz: Llama 4 verwendet die Llama 4 Community License von Meta — nicht Apache oder MIT. Sie enthält eine Acceptable-Use-Policy und eine separate Meta-Lizenzanforderung für Produkte mit mehr als 700 Millionen monatlich aktiven Nutzern. Prüfen Sie dies vor der kommerziellen Nutzung.
- Langer Kontext ist ein Speicherbudget, kein kostenloses Feature. Ein 10M-Token-Fenster bei voller Auslastung benötigt einen KV-Cache, der weit über den Gewichtsumfang hinausgeht. Dimensionieren Sie
num_ctx/--max-model-lenso, dass es in Ihren tatsächlichen Speicher passt. - Tokios leitet Bildinhalte und Tool-Aufruf-Felder an Ihren Upstream-Runtime weiter — es fügt keine Funktionen hinzu, die der Runtime oder die Quantisierung nicht unterstützt.
Muse Glimmer
Die aktuelle Open-Weight-Reihe von Meta — Apache 2.0, agentic und passt auf eine 24 GB-Karte.
Was passt zu Ihrer GPU?
Passen Sie die Modellgröße an Ihren VRAM oder Unified Memory an, bevor Sie den Download starten.
Quantisierung & Hardware
Welche Gewichtungsformate auf Ihrer GPU, Ihrem Mac oder einem System mit Unified Memory laufen.
Schnellstart
Verknüpfen Sie einen Connector und registrieren Sie Ihr erstes Modell von Anfang bis Ende.