Q4-class download is ~67 GB, Maverick’s is ~245 GB. Run the one that fits your hardware, then pair the Tokios connector to reach it as https://api.tokios.com from any OpenAI- or Anthropic-compatible client.
Meta社のモデル開発は現在Museシリーズへ移行しており、非公開重み版のMuse Sparkおよび公開重み版の Muse Glimmer 30Bが存在します。Llamaシリーズ自体は正式に廃止されておらず重み情報も引き続きダウンロード可能ですが、Llama 5のリリース予定はまだ発表されていません。
バリエーションとタグ
以下の数値はすべてOllamaライブラリおよびMeta社のHugging Faceモデル情報ページから引用しています。新たな量子化バージョンが公開されるたびにタグやサイズ情報は変動しますので、標準仕様として採用する前に ollama.com/library/llama4で最新情報をご確認ください。
出典:ollama.com/library/llama4/tags、Meta社によるLlama 4の発表、meta-llama/Llama-4-Scout-17B-16E-Instruct。
さらにLlama 4 Behemothというモデルも存在し、パラメータ数は約2テラに及び、このファミリーの教師モデルとして紹介されたが一般公開されていない。実際にダウンロード可能なのはScoutとMaverickのみだ。
なぜ「17Bアクティブ」な状態でも依然として67ギガバイトが必要なのか
MoEルーティングでは各トークンごとに17B個のパラメータが使用されるが、ルーターは各トークンごとに異なる専門家群を選択するため、すべての専門家の重み情報が常にメモリ上に保持されていなければならない。メモリ消費量はアクティブなパラメータ数ではなく総パラメータ数に基づいて算出される。- Scoutの場合:109B個のパラメータ×約0.5バイトで、
Q4クラス相当の重み情報は約55ギガバイト。実際の配布時にはオーバーヘッド分として約67ギガバイトが必要となる。 - Maverickの場合:400B個のパラメータ×約0.5バイトで、重み情報は約200ギガバイト。配布時には約245ギガバイトが必要だ。
ハードウェアへの適合性
適度なコンテキスト長であれば約Q4程度のメモリで問題なく動作する。各数値はあくまで推定値であり、正確な値は実際のダウンロードサイズと使用するコンテキスト分のKVキャッシュの合計となる。長いコンテキストを扱う場合、Scoutでは10Mという数値が示す通りKVキャッシュの消費量は多くのマシンの搭載メモリをはるかに超える。適切なモデルサイズの算出方法についてはどのサイズのモデルがGPUに適合するか?を参照されたい。
実行後は一つのエンドポイントからサービスを提供できる
TokiosにLlama 4のデプロイ情報を登録し、
sk-tok-… APIキーを使ってどのマシンからでも呼び出せる — GPU搭載マシン側でインバウンドポートを開く必要はない初心者から上級者まで利用可能
- Ollama(最も簡単)
- vLLM(マルチGPU対応)
http://127.0.0.1:11434ポートで待ち受けさせる。長文コンテキストを利用するにはOllamaの初期設定値よりもnum_ctx値を大きくする必要がある — ただし設定値は空きメモリ量に基づいて決定すべきで、10Mの記載値に固執すべきではない対応機能
- マルチモーダル入力: ScoutおよびMaverickはテキストと画像の両方をネイティブに受け付けますが、出力はテキストのみとなります。
- コンテキスト長: Scoutは10Mトークン分のコンテキストウィンドウを、Maverickは1Mトークン分をサポートしています。これらの長さに近いコンテキストを扱う場合、KVキャッシュのメモリ不足が生じる可能性があります。そのため、デプロイ計画を立てる前に KVキャッシュとコンテキスト の説明をご確認ください。
- 対応言語: Metaが公開するモデル説明欄によると、英語、ドイツ語、フランス語、スペイン語、ポルトガル語、ヒンディー語、ベトナム語を含む12種類の言語がサポートされています。
- 推論機能: 一般的な指示調整済みモデルであり、専用の思考モードは存在しません。段階的な推論結果を得たい場合は DeepSeek または gpt-oss をご利用ください。
Tokiosコネクターとの連携方法
1
ローカル環境のランタイムを常に稼働させておくこと
OllamaやvLLM、その他OpenAI互換のランタイム上でLlama 4を起動し、ループバック接続に固定しておきます。
2
Tokiosコネクターの設定
Sign in at tokios.com/console, open the Setup tab, and click Start pairing to get a one-time claim code (次に approve を開き、Setup または Connectors タブを選択します。
TKS-XXXX-XXXX). Run the installer on the machine that runs the model:Windows
macOS
Linux
3
デプロイを登録する
In the Models tab, register the upstream model id (for example
llama4:scout) under a public deployment name like llama4-tunnel. Clients send the deployment name in the model field, never the local id.4
APIキーを作成し、名称を付ける
In the Keys tab, click Create key, then:
注意点
- No consumer-GPU path. Unlike the 3.x line, neither Llama 4 model fits a 24–48 GB card in VRAM. llama.cpp-based runtimes can offload experts to system RAM, but throughput drops sharply once weights leave the GPU — budget for unified memory or a server before you standardize on Llama 4.
- ライセンス:Llama 4はMeta社の Llama 4コミュニティライセンス を利用しており、ApacheやMITライセンスではありません。利用目的に関する制限や、月間アクティブユーザー数が 700百万人を超える製品向けの別ライセンス要件も定められています。商用利用の際は必ず確認してください。
- Long context is a memory budget, not a free feature. A 10M-token window at full occupancy needs KV cache far beyond the weight footprint. Size
num_ctx/--max-model-lento what your memory actually holds. - Tokiosは画像コンテンツやツール呼び出し用フィールドをアップストリームランタイムへそのまま渡すだけで、ランタイムや量子化処理が対応していない機能を追加することはありません。
Muse Glimmer
Meta社が提供する現在のオープンウェイトモデル群で、Apache 2.0ライセンス下で利用可能。エージェント機能も備え、24GBのVRAMしか持たないGPUでも動作します。
どのGPUがご自身の環境に適しているかを確認しましょう。
ダウンロード前に、ご使用のVRAMまたはユニファイドメモリの容量に合わせてモデルサイズを調整してください。
量子化処理と対応ハードウェアについて
ご使用のGPU、Mac、またはユニファイドメモリ搭載機器で利用可能なウェイトフォーマットは何か。
クイックスタートガイド
コネクターをペアリングし、最初のモデルを一貫してデプロイして登録しましょう。