Q4 类下载量约为 67 GB,Maverick 的约为 245 GB。运行适合您硬件的版本,然后将 Tokios 连接器配对,使其作为 https://api.tokios.com 从任何 OpenAI 或 Anthropic 兼容客户端可达。
Meta 的模型开发已转向 Muse 系列 — 闭源权重的 Muse Spark 和开源权重的 Muse Glimmer 30B。Meta 尚未正式弃用 Llama,权重仍可下载,但尚未宣布任何 Llama 5。
变体与标签
以下所有值均来自 Ollama 库和 Meta 的 Hugging Face 模型卡片。标签和大小会随新量化版本发布而变化 — 在标准化选择之前,请对照 ollama.com/library/llama4 进行确认。
来源:ollama.com/library/llama4/tags、Meta 的 Llama 4 公告、meta-llama/Llama-4-Scout-17B-16E-Instruct。
第三款模型 Llama 4 Behemoth(约 2T 参数)曾作为该系列的教师模型进行预览,但尚未公开发售。目前仅可下载 Scout 和 Maverick。
为何“17B 活跃”仍需 67 GB
MoE 路由每个令牌激活 17B 个参数,但路由器为每个令牌选择不同的专家子集——因此 所有 专家权重必须保持加载。内存计算基于总参数而非活跃参数:- Scout:109B × 约 0.5 字节在
Q4级精度下 ≈ 55 GB 权重,含开销后约 67 GB - Maverick:400B × 约 0.5 字节 ≈ 200 GB 权重,含开销后约 245 GB
硬件适配
在上下文长度适中的情况下,约Q4 时运行舒适。请将每项数据视为估算值——实际情况取决于你的上下文所需的实际下载大小加上 KV 缓存,而长上下文 headline 数字(Scout 为 10M)会使 KV 缓存内存远超大多数机器所能承载的范围。有关容量计算,请参阅 什么大小的模型适合你的 GPU?。
运行后通过单一端点提供服务
将您的 Llama 4 部署注册到 Tokios,并使用
sk-tok-… 密钥从任何机器调用它 — 承载 GPU 的机器无需开放入站端口。运行它 — 从入门到高级
- Ollama(最简单)
- vLLM(多 GPU)
http://127.0.0.1:11434 上监听。将 num_ctx 提升到 Ollama 较小的默认值之上以使用长上下文 — 但请根据可用内存而非 10M 宣传值来设置其大小。功能特性
- 多模态输入: Scout 和 Maverick 原生支持文本和图像输入;输出仅为文本。
- 上下文: Scout 宣称拥有 10M 个令牌的窗口,而 Maverick 为 1M。在接近这些长度提供服务本身就是一个 KV 缓存内存问题 — 在围绕它们进行规划前,请参阅 KV 缓存与上下文。
- 语言: Meta 的模型卡片列出了 12 种支持的语言,包括英语、德语、法语、西班牙语、葡萄牙语、印地语和越南语。
- 推理: 通用指令微调模型 — 没有单独的思考模式。如需逐步推理输出,请参阅 DeepSeek 或 gpt-oss。
通过 Tokios 连接
1
保持本地运行时处于运行状态
在 Ollama、vLLM 或其他 OpenAI 兼容的运行时中启动 Llama 4,并将其绑定到回环地址。
2
配对 Tokios 连接器
在 tokios.com/console 登录,打开 Setup 选项卡,并点击 Start pairing 获取一次性领取代码(Then approve the device on the Setup or Connectors tab.
TKS-XXXX-XXXX)。在运行模型的那台机器上运行安装程序:Windows
macOS
Linux
3
注册部署
In the Models tab, register the upstream model id (for example
llama4:scout) under a public deployment name like llama4-tunnel. Clients send the deployment name in the model field, never the local id.4
创建 API 密钥并调用它
在 Keys 选项卡中,单击 Create key,然后:
注意事项
- 没有消费级 GPU 路径。 与 3.x 系列不同,Llama 4 模型均无法在 24–48 GB 显存的显卡中运行。基于 llama.cpp 的运行时可以将专家模块卸载到系统内存,但一旦权重离开 GPU,吞吐量会急剧下降 — 在标准化采用 Llama 4 之前,请为统一内存或服务器预留预算。
- 许可证: Llama 4 使用 Meta 的 Llama 4 社区许可证 — 不是 Apache 或 MIT。它附带可接受使用政策,并且对于月活跃用户超过 700 百万的产品,还需满足单独的 Meta 许可证要求。商业使用前请查阅。
- 长上下文是内存预算,而非免费功能。 满负载下的 10M 令牌窗口所需的 KV 缓存远超权重占用。请将
num_ctx/--max-model-len设置为你的内存实际能容纳的大小。 - Tokios 将图像内容和工具调用字段透传至你的上游运行时 — 它不会添加运行时或量化所不支持的功能。
Muse Glimmer
Meta 当前的开源权重系列 — Apache 2.0,支持智能体,并适配单张 24 GB 显卡。
什么适合你的 GPU?
在下载之前,根据你的显存或统一内存来调整模型大小。
量化与硬件
哪些权重格式可以在你的 GPU、Mac 或统一内存设备上运行。
快速入门
配对一个连接器并注册你的第一个端到端模型。