Skip to main content
Llama 4 是 Meta 最新的 Llama 版本(发布于 2025 月):原生多模态(文本 + 图像输入)混合专家模型,支持超长上下文。两个开源权重版本 — Scout(109B 总计 / 17B 激活)和 Maverick(400B 总计 / 17B 激活)— 每个令牌仅激活 17B 个参数,但所有专家权重必须驻留在内存中。这使得它们成为大统一内存或多 GPU 模型,而非单消费级 GPU 可拉取的模型:Scout 的 Q4 类下载量约为 67 GB,Maverick 的约为 245 GB。运行适合您硬件的版本,然后将 Tokios 连接器配对,使其作为 https://api.tokios.com 从任何 OpenAI 或 Anthropic 兼容客户端可达。
Meta 的模型开发已转向 Muse 系列 — 闭源权重的 Muse Spark 和开源权重的 Muse Glimmer 30B。Meta 尚未正式弃用 Llama,权重仍可下载,但尚未宣布任何 Llama 5。
Want a Llama that fits a single 24 GB GPU? ollama run llama3.1:8b or ollama run llama3.3:70b — the 3.x line is still the practical single-GPU choice. Llama 4 is what you step up to on 96 GB+ unified memory or a multi-GPU server.

变体与标签

以下所有值均来自 Ollama 库和 Meta 的 Hugging Face 模型卡片。标签和大小会随新量化版本发布而变化 — 在标准化选择之前,请对照 ollama.com/library/llama4 进行确认。 来源:ollama.com/library/llama4/tagsMeta 的 Llama 4 公告meta-llama/Llama-4-Scout-17B-16E-Instruct
第三款模型 Llama 4 Behemoth(约 2T 参数)曾作为该系列的教师模型进行预览,但尚未公开发售。目前仅可下载 Scout 和 Maverick。

为何“17B 活跃”仍需 67 GB

MoE 路由每个令牌激活 17B 个参数,但路由器为每个令牌选择不同的专家子集——因此 所有 专家权重必须保持加载。内存计算基于总参数而非活跃参数:
  • Scout:109B × 约 0.5 字节在 Q4 级精度下 ≈ 55 GB 权重,含开销后约 67 GB
  • Maverick:400B × 约 0.5 字节 ≈ 200 GB 权重,含开销后约 245 GB
活跃参数数量带来的是 速度 而非容量:每个令牌的计算量相当于一个 17B 模型,因此在内存充足的硬件上,Llama 4 的生成速度比总参数量相近的稠密模型更快。有关运行时如何处理接近内存上限的模型,请参阅 内存与卸载

硬件适配

在上下文长度适中的情况下,约 Q4 时运行舒适。请将每项数据视为估算值——实际情况取决于你的上下文所需的实际下载大小加上 KV 缓存,而长上下文 headline 数字(Scout 为 10M)会使 KV 缓存内存远超大多数机器所能承载的范围。有关容量计算,请参阅 什么大小的模型适合你的 GPU?

运行后通过单一端点提供服务

将您的 Llama 4 部署注册到 Tokios,并使用 sk-tok-… 密钥从任何机器调用它 — 承载 GPU 的机器无需开放入站端口。

运行它 — 从入门到高级

让 Ollama 在默认 http://127.0.0.1:11434 上监听。将 num_ctx 提升到 Ollama 较小的默认值之上以使用长上下文 — 但请根据可用内存而非 10M 宣传值来设置其大小。

功能特性

  • 多模态输入: Scout 和 Maverick 原生支持文本和图像输入;输出仅为文本。
  • 上下文: Scout 宣称拥有 10M 个令牌的窗口,而 Maverick 为 1M。在接近这些长度提供服务本身就是一个 KV 缓存内存问题 — 在围绕它们进行规划前,请参阅 KV 缓存与上下文
  • 语言: Meta 的模型卡片列出了 12 种支持的语言,包括英语、德语、法语、西班牙语、葡萄牙语、印地语和越南语。
  • 推理: 通用指令微调模型 — 没有单独的思考模式。如需逐步推理输出,请参阅 DeepSeekgpt-oss

通过 Tokios 连接

1

保持本地运行时处于运行状态

在 Ollama、vLLM 或其他 OpenAI 兼容的运行时中启动 Llama 4,并将其绑定到回环地址。
2

配对 Tokios 连接器

tokios.com/console 登录,打开 Setup 选项卡,并点击 Start pairing 获取一次性领取代码(TKS-XXXX-XXXX)。在运行模型的那台机器上运行安装程序:
Windows
macOS
Linux
Then approve the device on the Setup or Connectors tab.
3

注册部署

In the Models tab, register the upstream model id (for example llama4:scout) under a public deployment name like llama4-tunnel. Clients send the deployment name in the model field, never the local id.
4

创建 API 密钥并调用它

Keys 选项卡中,单击 Create key,然后:

注意事项

  • 没有消费级 GPU 路径。 与 3.x 系列不同,Llama 4 模型均无法在 24–48 GB 显存的显卡中运行。基于 llama.cpp 的运行时可以将专家模块卸载到系统内存,但一旦权重离开 GPU,吞吐量会急剧下降 — 在标准化采用 Llama 4 之前,请为统一内存或服务器预留预算。
  • 许可证: Llama 4 使用 Meta 的 Llama 4 社区许可证 — 不是 Apache 或 MIT。它附带可接受使用政策,并且对于月活跃用户超过 700 百万的产品,还需满足单独的 Meta 许可证要求。商业使用前请查阅。
  • 长上下文是内存预算,而非免费功能。 满负载下的 10M 令牌窗口所需的 KV 缓存远超权重占用。请将 num_ctx / --max-model-len 设置为你的内存实际能容纳的大小。
  • Tokios 将图像内容和工具调用字段透传至你的上游运行时 — 它不会添加运行时或量化所不支持的功能。

Muse Glimmer

Meta 当前的开源权重系列 — Apache 2.0,支持智能体,并适配单张 24 GB 显卡。

什么适合你的 GPU?

在下载之前,根据你的显存或统一内存来调整模型大小。

量化与硬件

哪些权重格式可以在你的 GPU、Mac 或统一内存设备上运行。

快速入门

配对一个连接器并注册你的第一个端到端模型。