Skip to main content
Llama 4 ist die neueste Llama-Veröffentlichung von Meta (April 2025): nativ multimodale (Text- und Bild-Eingabe) Mixture-of-Experts-Modelle mit sehr langem Kontext. Beide Open-Weight-Releases — Scout (109B gesamt / 17B aktiv) und Maverick (400B gesamt / 17B aktiv) — aktivieren nur 17B Parameter pro Token, aber alle Experten-Gewichte müssen im Speicher resident bleiben. Das macht sie zu Modellen mit großem einheitlichem Speicher oder Multi-GPU-Modellen, keine einzelnen Consumer-GPU-Downloads: Scout’s Q4-Klasse-Download ist ~67 GB, Maverick’s ist ~245 GB. Führen Sie das aus, das zu Ihrer Hardware passt, und koppeln Sie dann den Tokios-Connector, um es als https://api.tokios.com von jedem OpenAI- oder Anthropic-kompatiblen Client zu erreichen.
Metas Modellentwicklung hat sich auf die Muse-Linie verlagert — das Closed-Weight Muse Spark und das Open-Weight Muse Glimmer 30B. Meta hat Llama nicht offiziell eingestellt, und die Gewichte sind weiterhin herunterladbar, aber es wurde kein Llama 5 angekündigt.
Möchten Sie ein Llama, das auf eine einzelne 24 GB GPU passt? ollama run llama3.1:8b oder ollama run llama3.3:70b — die 3.x-Linie ist immer noch die praktische Single-GPU-Wahl. Llama 4 ist das, worauf Sie bei 96 GB+ einheitlichem Speicher oder einem Multi-GPU-Server umsteigen.

Varianten & Tags

Jeder untenstehende Wert stammt aus der Ollama-Bibliothek und den Hugging Face-Modellkarten von Meta. Tags und Größen ändern sich, wenn neue Quantisierungen veröffentlicht werden — bestätigen Sie dies vor der Standardisierung auf einen Tag mit ollama.com/library/llama4. Quellen: ollama.com/library/llama4/tags, Metas Llama 4 Ankündigung, meta-llama/Llama-4-Scout-17B-16E-Instruct.
Ein drittes Modell, Llama 4 Behemoth (~2T Parameter), wurde als Lehrermodell für die Familie vorgestellt, ist jedoch nicht öffentlich verfügbar. Nur Scout und Maverick sind herunterladbar.

Warum “17B aktiv” immer noch 67 GB benötigt

MoE-Routing aktiviert 17B Parameter pro Token, aber der Router wählt für jedes Token eine andere Teilmenge von Experten aus — daher müssen alle Experten-Gewichte geladen bleiben. Die Speicherberechnung wird durch die Gesamtzahl der Parameter bestimmt, nicht durch die aktiven:
  • Scout: 109B × ~0.5 Bytes bei Q4-Klasse ≈ 55 GB Gewichte, ~67 GB wie ausgeliefert mit Overhead
  • Maverick: 400B × ~0.5 Bytes ≈ 200 GB Gewichte, ~245 GB wie ausgeliefert
Was die Anzahl der aktiven Parameter bringt, ist Geschwindigkeit, nicht Platzersparnis: Der Pro-Token-Compute entspricht dem eines 17B Modells, daher erzeugt Llama 4 auf Hardware mit ausreichend Speicher schneller als ein dichtes Modell ähnlicher Gesamtgröße. Siehe Speicher und Auslagerung für die Handhabung von Modellen nahe der Speicherbegrenzung durch Runtimes.

Hardware-Eignung

Komfortabel bei etwa Q4 mit einer moderaten Kontextlänge. Betrachten Sie jeden Eintrag als Schätzung — die Wahrheit ist die tatsächliche Download-Größe plus KV-Cache für Ihren Kontext, und die Langkontext-Kopfnummern (10M für Scout) multiplizieren den KV-Cache-Speicher weit über das hinaus, was die meisten Maschinen halten. Siehe Welche Modellgröße passt auf Ihre GPU? für die Größenberechnung.

Stellen Sie es nach dem Start über einen einzigen Endpunkt bereit

Registrieren Sie Ihre Llama 4-Deployment bei Tokios und rufen Sie sie von jedem Rechner mit einem sk-tok-…-Schlüssel auf — keine eingehenden Ports auf dem Rechner mit den GPUs.

Ausführen — vom Anfänger bis zum Fortgeschrittenen

Lassen Sie Ollama am Standard-http://127.0.0.1:11434 lauschen. Erhöhen Sie num_ctx über Ollamas kleines Standardlimit hinaus, um den langen Kontext zu nutzen — dimensionieren Sie es jedoch nach Ihrem freien Arbeitsspeicher und nicht nach der 10M-Kopffläche.

Fähigkeiten

  • Multimodale Eingabe: Scout und Maverick akzeptieren nativ Text und Bilder; die Ausgabe ist nur Text.
  • Kontext: Scout wirbt mit einem 10M-Token-Fenster und Maverick mit 1M. Das Serving in der Nähe dieser Längen ist ein eigenes KV-Cache-Speicherproblem — siehe KV-Cache und Kontext, bevor Sie darauf basierend planen.
  • Sprachen: Die Modellkarten von Meta listen 12 unterstützte Sprachen auf, darunter Englisch, Deutsch, Französisch, Spanisch, Portugiesisch, Hindi und Vietnamesisch.
  • Reasoning: Allgemeine, mit Anweisungen abgestimmte Modelle — kein separater Denkmodus. Für schrittweise Reasoning-Ausgaben siehe DeepSeek oder gpt-oss.

Verbinden Sie es mit Tokios

1

Halten Sie Ihre lokale Laufzeit am Laufen

Starten Sie Llama 4 in Ollama, vLLM oder einer anderen OpenAI-kompatiblen Laufzeit und lassen Sie es an Loopback gebunden.
2

Paaren Sie den Tokios-Connector

Melden Sie sich bei tokios.com/console an, öffnen Sie die Setup-Registerkarte und klicken Sie auf Start pairing, um einen einmaligen Claim-Code (TKS-XXXX-XXXX) zu erhalten. Führen Sie den Installer auf dem Computer aus, auf dem das Modell läuft:
Windows
macOS
Linux
Dann approve das Gerät auf der Setup- oder Connectors-Registerkarte.
3

Eine Deployment registrieren

Tragen Sie im Models-Tab die Upstream-Modell-ID (z. B. llama4:scout) unter einem öffentlichen Deployment-Namen wie llama4-tunnel ein. Clients senden den Deployment-Namen im model-Feld, niemals die lokale ID.
4

Einen API-Schlüssel erstellen und benennen

Klicken Sie im Keys-Tab auf Create key, dann:

Hinweise

  • Kein Consumer-GPU-Pfad. Im Gegensatz zur 3.x-Reihe passt weder das Llama 4-Modell mit 24–48 GB VRAM auf eine Karte. llama.cpp-basierte Runtimes können Experten auf den Systemspeicher auslagern, aber der Durchsatz sinkt stark, sobald Gewichte die GPU verlassen — planen Sie Unified Memory oder einen Server ein, bevor Sie sich auf Llama 4 festlegen.
  • Lizenz: Llama 4 verwendet die Llama 4 Community License von Meta — nicht Apache oder MIT. Sie enthält eine Acceptable-Use-Policy und eine separate Meta-Lizenzanforderung für Produkte mit mehr als 700 Millionen monatlich aktiven Nutzern. Prüfen Sie dies vor der kommerziellen Nutzung.
  • Langer Kontext ist ein Speicherbudget, kein kostenloses Feature. Ein 10M-Token-Fenster bei voller Auslastung benötigt einen KV-Cache, der weit über den Gewichtsumfang hinausgeht. Dimensionieren Sie num_ctx / --max-model-len so, dass es in Ihren tatsächlichen Speicher passt.
  • Tokios leitet Bildinhalte und Tool-Aufruf-Felder an Ihren Upstream-Runtime weiter — es fügt keine Funktionen hinzu, die der Runtime oder die Quantisierung nicht unterstützt.

Muse Glimmer

Die aktuelle Open-Weight-Reihe von Meta — Apache 2.0, agentic und passt auf eine 24 GB-Karte.

Was passt zu Ihrer GPU?

Passen Sie die Modellgröße an Ihren VRAM oder Unified Memory an, bevor Sie den Download starten.

Quantisierung & Hardware

Welche Gewichtungsformate auf Ihrer GPU, Ihrem Mac oder einem System mit Unified Memory laufen.

Schnellstart

Verknüpfen Sie einen Connector und registrieren Sie Ihr erstes Modell von Anfang bis Ende.