Skip to main content
Llama 4 is Meta’s most recent Llama release (April 2025): natively multimodal (text + image input) mixture-of-experts models with very long context. Both open-weight releases — Scout (109B total / 17B active) and Maverick (400B total / 17B active) — activate only 17B parameters per token, but all expert weights must stay resident in memory. That makes them big-unified-memory or multi-GPU models, not single consumer-GPU pulls: Scout’s Q4-class download is ~67 GB, Maverick’s is ~245 GB. Run the one that fits your hardware, then pair the Tokios connector to reach it as https://api.tokios.com from any OpenAI- or Anthropic-compatible client.
Meta社のモデル開発は現在Museシリーズへ移行しており、非公開重み版のMuse Sparkおよび公開重み版の Muse Glimmer 30Bが存在します。Llamaシリーズ自体は正式に廃止されておらず重み情報も引き続きダウンロード可能ですが、Llama 5のリリース予定はまだ発表されていません。
Want a Llama that fits a single 24 GB GPU? ollama run llama3.1:8b or ollama run llama3.3:70b — the 3.x line is still the practical single-GPU choice. Llama 4 is what you step up to on 96 GB+ unified memory or a multi-GPU server.

バリエーションとタグ

以下の数値はすべてOllamaライブラリおよびMeta社のHugging Faceモデル情報ページから引用しています。新たな量子化バージョンが公開されるたびにタグやサイズ情報は変動しますので、標準仕様として採用する前に ollama.com/library/llama4で最新情報をご確認ください。 出典:ollama.com/library/llama4/tagsMeta社によるLlama 4の発表meta-llama/Llama-4-Scout-17B-16E-Instruct
さらにLlama 4 Behemothというモデルも存在し、パラメータ数は約2テラに及び、このファミリーの教師モデルとして紹介されたが一般公開されていない。実際にダウンロード可能なのはScoutとMaverickのみだ。

なぜ「17Bアクティブ」な状態でも依然として67ギガバイトが必要なのか

MoEルーティングでは各トークンごとに17B個のパラメータが使用されるが、ルーターは各トークンごとに異なる専門家群を選択するため、すべての専門家の重み情報が常にメモリ上に保持されていなければならない。メモリ消費量はアクティブなパラメータ数ではなく総パラメータ数に基づいて算出される。
  • Scoutの場合:109B個のパラメータ×約0.5バイトで、Q4クラス相当の重み情報は約55ギガバイト。実際の配布時にはオーバーヘッド分として約67ギガバイトが必要となる。
  • Maverickの場合:400B個のパラメータ×約0.5バイトで、重み情報は約200ギガバイト。配布時には約245ギガバイトが必要だ。
アクティブなパラメータ数がもたらすのは速度の向上であり、メモリ容量の節約ではない。各トークン処理に必要な計算量は17B規模のモデルと同等なので、十分なメモリを備えたハードウェア上ではLlama 4は同規模の通常モデルよりも高速に生成処理を行える。メモリ上限付近でモデルを運用する際の仕組みについてはメモリとオフロードを参照されたい。

ハードウェアへの適合性

適度なコンテキスト長であれば約Q4程度のメモリで問題なく動作する。各数値はあくまで推定値であり、正確な値は実際のダウンロードサイズと使用するコンテキスト分のKVキャッシュの合計となる。長いコンテキストを扱う場合、Scoutでは10Mという数値が示す通りKVキャッシュの消費量は多くのマシンの搭載メモリをはるかに超える。適切なモデルサイズの算出方法についてはどのサイズのモデルがGPUに適合するか?を参照されたい。

実行後は一つのエンドポイントからサービスを提供できる

TokiosにLlama 4のデプロイ情報を登録し、sk-tok-… APIキーを使ってどのマシンからでも呼び出せる — GPU搭載マシン側でインバウンドポートを開く必要はない

初心者から上級者まで利用可能

Ollamaを既定のhttp://127.0.0.1:11434ポートで待ち受けさせる。長文コンテキストを利用するにはOllamaの初期設定値よりもnum_ctx値を大きくする必要がある — ただし設定値は空きメモリ量に基づいて決定すべきで、10Mの記載値に固執すべきではない

対応機能

  • マルチモーダル入力: ScoutおよびMaverickはテキストと画像の両方をネイティブに受け付けますが、出力はテキストのみとなります。
  • コンテキスト長: Scoutは10Mトークン分のコンテキストウィンドウを、Maverickは1Mトークン分をサポートしています。これらの長さに近いコンテキストを扱う場合、KVキャッシュのメモリ不足が生じる可能性があります。そのため、デプロイ計画を立てる前に KVキャッシュとコンテキスト の説明をご確認ください。
  • 対応言語: Metaが公開するモデル説明欄によると、英語、ドイツ語、フランス語、スペイン語、ポルトガル語、ヒンディー語、ベトナム語を含む12種類の言語がサポートされています。
  • 推論機能: 一般的な指示調整済みモデルであり、専用の思考モードは存在しません。段階的な推論結果を得たい場合は DeepSeek または gpt-oss をご利用ください。

Tokiosコネクターとの連携方法

1

ローカル環境のランタイムを常に稼働させておくこと

OllamaやvLLM、その他OpenAI互換のランタイム上でLlama 4を起動し、ループバック接続に固定しておきます。
2

Tokiosコネクターの設定

Sign in at tokios.com/console, open the Setup tab, and click Start pairing to get a one-time claim code (TKS-XXXX-XXXX). Run the installer on the machine that runs the model:
Windows
macOS
Linux
次に approve を開き、Setup または Connectors タブを選択します。
3

デプロイを登録する

In the Models tab, register the upstream model id (for example llama4:scout) under a public deployment name like llama4-tunnel. Clients send the deployment name in the model field, never the local id.
4

APIキーを作成し、名称を付ける

In the Keys tab, click Create key, then:

注意点

  • No consumer-GPU path. Unlike the 3.x line, neither Llama 4 model fits a 24–48 GB card in VRAM. llama.cpp-based runtimes can offload experts to system RAM, but throughput drops sharply once weights leave the GPU — budget for unified memory or a server before you standardize on Llama 4.
  • ライセンス:Llama 4はMeta社の Llama 4コミュニティライセンス を利用しており、ApacheやMITライセンスではありません。利用目的に関する制限や、月間アクティブユーザー数が 700百万人を超える製品向けの別ライセンス要件も定められています。商用利用の際は必ず確認してください。
  • Long context is a memory budget, not a free feature. A 10M-token window at full occupancy needs KV cache far beyond the weight footprint. Size num_ctx / --max-model-len to what your memory actually holds.
  • Tokiosは画像コンテンツやツール呼び出し用フィールドをアップストリームランタイムへそのまま渡すだけで、ランタイムや量子化処理が対応していない機能を追加することはありません。

Muse Glimmer

Meta社が提供する現在のオープンウェイトモデル群で、Apache 2.0ライセンス下で利用可能。エージェント機能も備え、24GBのVRAMしか持たないGPUでも動作します。

どのGPUがご自身の環境に適しているかを確認しましょう。

ダウンロード前に、ご使用のVRAMまたはユニファイドメモリの容量に合わせてモデルサイズを調整してください。

量子化処理と対応ハードウェアについて

ご使用のGPU、Mac、またはユニファイドメモリ搭載機器で利用可能なウェイトフォーマットは何か。

クイックスタートガイド

コネクターをペアリングし、最初のモデルを一貫してデプロイして登録しましょう。