Skip to main content
最后验证时间:2026-08-10
Muse Glimmer is Meta Superintelligence Labs’ open-weight agent model, released August 2026 under Apache 2.0. It is a dense 29.6B-parameter causal transformer with a built-in 1.8B ViT-G/14 perception encoder, a 131,072-token context window, and text-plus-image input. Meta built it for always-on local agents: tool calls with precise schemas, multi-step reasoning, and retry after failure — on one consumer GPU or a Mac. 对于自托管而言,最重要的数字是 18 GB。这是 4 位下载版本,也是该模型能够适配你很可能已经拥有的硬件的原因。
已经在运行此模型?在 Tokios 上注册它 以便从任何客户端通过 https://api.tokios.com 访问它。

Muse Glimmer 概览

来源:Meta 的 Muse Glimmer 公告 和 模型卡片。
教师模型 Muse Spark 尚未发布。 Meta 的公告仅涵盖 Muse Glimmer 权重。部分报道表明 Muse Spark 1.2 权重可能会随后发布 — 在 Meta 发布仓库之前,请将其视为未确认。

变体和标签

Ollama 发布 13 构建版本。-dflash 变体捆绑了推测解码的草稿生成器,它消耗约 2 GB 内存并带来显著的速度提升 — 详见下方的 DFlash 推测解码。 每个标签都携带完整的 131,072 令牌上下文,并接受文本和图像。Meta 自己的 GGUF 仓库 meta-models/Muse-Glimmer-30B-GGUF 将其两个 K-quant 构建命名为 muse-glimmer-30B-kquant-17gb.gguf(目标 24 GB 显存)和 muse-glimmer-30B-kquant-dynamic.gguf(目标 32 GB),其中草稿模型为 dflash-kquant.gguf。 在标准化之前,请对照 ollama.com/library/muse-glimmer 确认大小 — 量化版本会重新切割。

为什么密集模型在此处很重要

最近的旗舰版本几乎全是混合专家(MoE)架构,而 MoE 存在一个内存陷阱:路由机制每个 token 只激活部分参数,但所有专家权重都常驻内存。Llama 4 Scout 仅激活 17B 个参数,仍需约 67 GB 内存,因为内存占用取决于总参数量而非激活参数量。 Muse Glimmer 在 30B 处采用密集架构,以确保整个模型能够装入内存。其计算过程平平无奇,而这正是其要点所在:
  • 29.6B 个参数 × 约 0.5 字节(在 4 位精度下)≈ 15 GB 的权重
  • 包含视觉编码器、嵌入层和元数据后,原始大小约为 18 GB
  • 在此基础上添加上下文所需的 KV 缓存 — 详见 KV 缓存和上下文
无需规划卸载层级,也无需设计专家并行拓扑。如果你拥有 24 GB 内存,模型即可常驻。有关权重溢出 GPU 后的变化,请参阅 内存与卸载。

硬件适配

评估结果基于 4 位构建版本,并在适中的上下文长度下进行测试。Meta 报告称在 MacBook M4 Max、M5 Max 和 RTX 5090 上进行了测试。 在 24 GB 的显卡上,-dflash 构建版本可以运行,但草稿生成器和长上下文会争夺相同的显存空间。从较小的上下文开始,进行测量,然后再逐步增加。有关容量估算方法,请参阅 什么尺寸的模型适合你的 GPU?。

已选择模型?连接它

在 https://api.tokios.com 处有一个经过身份验证的端点 — 无需开放入站端口,耗时约 5 分钟。

运行它 — 从入门到进阶

如果内存紧张,请丢弃 -dflash。若要绕过 Ollama 的库构建,直接拉取 Meta 的 GGUF 仓库:
让 Ollama 保持其默认的 http://127.0.0.1:11434,仅根据可用内存情况将 num_ctx 从其较小的默认值适度调高。请参阅 Ollama 远程访问。

采样设置

Meta 推荐 temperature = 1.0、top_p = 0.95 和 top_k = 64。1.0 的温度高于许多本地模型所期望的值 — 将其降低到适合其他检查点的 0.6–0.7 范围是导致此处输出质量下降的常见原因。

DFlash 推测解码

DFlash 是一个轻量级辅助模型,它提出 16 个 token 的块供主模型在一次传递中验证,而不是严格地一次生成一个 token。Meta 报告称: 此方案引人注目的原因在于打包,而非新颖性。推测解码通常意味着获取兼容的草稿模型并自行调整配对。此处草稿模型随权重一起提供,且 -dflash Ollama 标签在拉取时即可启用 — 大约 2 GB,否则你将花费整个下午进行配置以获得此速度提升。 加速效果针对的是解码阶段,因此在输出较长的场景中收益最大,例如在 high 或 xhigh 中的智能体循环、代码生成以及扩展推理。对于简短回答,其提升有限。有关机制及如何在自有硬件上衡量收益,请参阅 推测解码。

功能特性

  • 可控推理。 在系统提示词中使用 Reasoning strength: low(或 medium、high、xhigh)设置强度。较高的设置会在回答前消耗更多令牌——针对复杂任务可提高该值,针对低延迟需求则降低该值。
  • 视觉能力。 感知编码器是模型的一部分,而非外挂组件,因此任何构建版本均支持图像输入。输出仅为文本。
  • 智能体用途。 Meta 针对端到端任务完成对其进行了训练和评估,包括规划、针对精确模式调用工具、检查结果以及从失败中恢复。这与通用聊天模型的目标不同——请参阅 使用本地模型的编码智能体。
  • Multilingual. 100+ languages.

基准测试

由 Meta 报告,基于今日发布的模型。目前尚无独立复现结果——在第三方评估出现之前,请将这些数据视为厂商声明。 Meta 将 Muse Glimmer 定位为与 Gemma 4 31B 和 Qwen3.6 27B 竞争,涵盖智能体、编码、多模态、安全和推理任务 — 它们属于同一尺寸类别,因此在切换前请先根据你的工作负载进行比较。

使用 Tokios 连接它

常驻本地智能体是指当你不在运行它的机器上时,你仍希望访问的智能体。Tokios 位于你的运行时之后:它不会下载模型,也不会替换 Ollama。
1

保持本地运行时处于运行状态

在 Ollama、LM Studio、llama.cpp 或 vLLM 中启动 Muse Glimmer,并将其绑定到回环地址。
2

配对 Tokios 连接器

在 tokios.com/console 登录,打开 Setup 选项卡,然后点击 Start pairing 获取一次性领取代码(TKS-XXXX-XXXX)。在运行模型的机器上运行安装程序:
Windows
macOS
Linux
Then approve the device on the Setup or Connectors tab.
3

注册一个部署

In the Models tab, register the upstream model id (for example muse-glimmer:30b-q4_K_M-dflash) under a public deployment name like muse-glimmer. Clients send the deployment name in the model field, never the local id — so re-quantizing later changes nothing on the client side.
4

创建 API 密钥

在 Keys 选项卡中,点击 Create key。立即复制 sk-tok-… 密钥 — 它仅显示一次。

从任何地方调用

注意事项

  • 基准测试由供应商报告。 Meta 在发布日发布了这些数据。在将编码分数视为定论之前,请等待独立评估结果。
  • 131,072 令牌是上限,而非目标。 长上下文会在 18 GB 权重之上增加 KV 缓存内存,而在 24 GB 显卡上,这恰好是 DFlash 草稿器也需要的余量。
  • 温度 1.0 是推荐值。 未经测试,请勿从其他本地模型沿用采样设置。
  • 视觉和工具调用取决于您的运行时。 Tokios 将图像内容和工具调用字段透传至上游端点 — 它不会添加您的运行时或量化所缺乏的功能。请查看 支持的后端。
  • Apache 2.0 对 Meta 而言是一项实质性变更。 Llama 4 在 Llama 4 社区许可证下发布,附带可接受使用政策及针对大型产品的阈值。Muse Glimmer 则没有这些限制,但在基于其构建之前,请自行阅读许可证。

常见问题

18 GB for the 4-bit q4_K_M build, or 20 GB with the DFlash drafter — so a 24 GB card such as an RTX 3090 or 4090 runs it, with the remaining headroom going to KV cache. The 8-bit build needs 31 GB and BF16 needs 57 GB. The transparent calculation: 29.6B parameters × ~0.5 bytes at 4-bit ≈ 15 GB of weights, plus the vision encoder, embeddings, and overhead.
可以。这是本次发布的重点 — 一个密集的 30B 代理模型,在 4 位下完全驻留在一张消费级显卡上。使用 muse-glimmer:30b-q4_K_M 在 18 GB,或者如果你想要推测解码 drafter 并且有足够内存,使用 muse-glimmer:30b-q4_K_M-dflash 在 20 GB。
权重在 Apache 2.0 许可下发布,这是一种宽松许可,没有可接受使用政策或用户数量限制。这与 Llama 4 使用的 Llama 社区许可不同。请注意,开放权重和开源不是一回事 — 训练数据和管道并未发布。
A lightweight drafter model that ships alongside Muse Glimmer. It proposes blocks of 16 tokens which the main model verifies in a single pass, rather than decoding one token at a time. Meta reports 3.1x on an RTX 5090, 1.8x on an M5 Max, and 1.5x on an M4 Max. Pull an Ollama tag ending in -dflash to get it — no separate configuration.
Meta 自己的基准测试将其与 Gemma 4 31B 和 Qwen3.6 27B 进行比较,并倾向于 Muse Glimmer,但这些是发布当天由厂商运行的数字。所有 3 都处于相同的尺寸类别并在相同的硬件上运行,因此实际答案是服务每一个并测试你的实际工作负载 — 参见 Qwen3.6 和 Gemma。
不是。它是来自 Meta Superintelligence Labs 的新家族,从更大的教师模型 Muse Spark 蒸馏而来,具有不同的架构和与 Llama 4 不同的许可。Llama 系列是独立的,仍然使用 Llama 社区许可。
在系统提示中放入 Reasoning strength: low、medium、high 或 xhigh。更高的设置会在回答前消耗更多令牌进行推理,从而提升复杂任务的质量并增加延迟。这也会通过 Tokios 传递 — 在你的 API 调用中设置 system 消息。
可以 — 它专为这一用途而构建,支持针对精确模式进行工具调用,并在多步骤工作流中实现故障恢复。特定代理是否可用取决于你的运行时如何暴露工具调用;请参阅 编码代理兼容性 查看矩阵,以及 使用本地模型的编码代理 了解设置方法。

推测性解码

DFlash 风格的草稿生成器的工作原理,以及如何自行测量加速效果。

使用本地模型的编码代理

将 Claude Code、Cline 或 Aider 指向你托管的模型。

你的 GPU 适合哪种模型?

根据你的 VRAM 或统一内存来调整模型大小和上下文。

Llama 4

Meta 的混合专家系列,以及为何 17B 个激活参数仍需 67 GB 内存。

通过手机访问

在离开计算机时,使用始终在线的本地代理。

快速入门

配对一个连接器并端到端注册你的第一个模型。