Skip to main content
마지막 확인: 2026-08-10
Muse Glimmer is Meta Superintelligence Labs’ open-weight agent model, released August 2026 under Apache 2.0. It is a dense 29.6B-parameter causal transformer with a built-in 1.8B ViT-G/14 perception encoder, a 131,072-token context window, and text-plus-image input. Meta built it for always-on local agents: tool calls with precise schemas, multi-step reasoning, and retry after failure — on one consumer GPU or a Mac. 자체 호스팅에 중요한 수치는 18 GB입니다. 이는 4-bit 다운로드 버전이며, 이 모델이 이미 보유하고 있을 가능성이 있는 하드웨어에 적합하기 때문입니다.
Already running this model? Register it with Tokios to reach it as https://api.tokios.com from any client.

Muse Glimmer 한눈에 보기

출처: Meta의 Muse Glimmer 발표 및 모델 카드.
Muse Spark, 교사 모델, 는 출시되지 않았습니다. Meta의 발표는 Muse Glimmer 가중치만을 다룹니다. 일부 보도에서는 Muse Spark 1.2 가중치가 뒤따를 수 있다고 시사하지만, Meta가 저장소를 게시할 때까지 이를 미확인 사항으로 간주하십시오.

변형 및 태그

Ollama는 13 빌드를 게시합니다. -dflash 변형은 약 2 GB의 비용으로 상당한 속도 향상을 제공하는 예측 디코딩 드래프터를 번들로 제공합니다. 아래 DFlash 예측 디코딩을 참조하십시오. 모든 태그는 전체 131,072 토큰 컨텍스트를 포함하며 텍스트와 이미지를 허용합니다. Meta의 자체 GGUF 리포지토리인 meta-models/Muse-Glimmer-30B-GGUF는 두 가지 K-quant 빌드를 muse-glimmer-30B-kquant-17gb.gguf (24 GB VRAM 대상)과 muse-glimmer-30B-kquant-dynamic.gguf (32 GB 대상)으로 명명하며, 드래프터는 dflash-kquant.gguf입니다. 하나의 정량화에 표준화하기 전에 ollama.com/library/muse-glimmer에서 크기를 확인하십시오. 정량화는 다시 잘려집니다.

여기서 밀집형이 중요한 이유

최근 플래그십 릴리스는 거의 모두 mixture-of-experts이며, MoE에는 메모리 함정이 있습니다. 라우팅은 토큰당 매개변수의 일부를 활성화하지만 모든 전문가 가중치는 상주해 있습니다. Llama 4 Scout은 17B 매개변수를 활성화하지만 여전히 ~67 GB가 필요하며, 이는 메모리가 활성화된 매개변수가 아닌 총 매개변수에 따라 스케일되기 때문입니다. Muse Glimmer은 30B에서 밀집형으로 설계되어 모델 전체가fits하도록 했습니다. 이 산술은 특별할 것이 없으며, 그것이 핵심입니다.
  • 29.6B 매개변수 × ~0.5 바이트 at 4-비트 ≈ 15 GB의 가중치
  • 비전 인코더, 임베딩 및 메타데이터를 포함하면 ~18 GB로 shipped됩니다.
  • Add KV cache for your context on top — see KV cache and context
계획할 offloading tier도 없고, 전문가 병렬성 토폴로지를 설계할 필요도 없습니다. 24 GB가 있다면 모델은 상주합니다. 가중치가 GPU를 넘어 스팁될 때 변경되는 사항에 대해서는 memory and offloading을 참조하세요.

하드웨어 적합성

평결은 적당한 컨텍스트 길이의 4-비트 빌드를 기준으로 합니다. Meta는 MacBook M4 Max, M5 Max 및 RTX 5090에서 테스트했다고 보고합니다. On a 24 GB card the -dflash build fits, but the drafter and a long context compete for the same headroom. Start at a modest context, measure, then raise it. For the sizing method, see what size model fits your GPU?.

모델을 선택하셨나요? 연결하세요

One authenticated endpoint at https://api.tokios.com — no inbound ports, about 5 minutes.

실행하기 — 초보자부터 고급까지

메모리가 부족하면 -dflash 을 제거하세요. Ollama 라이브러리 빌드 대신 Meta의 GGUF 리포지토리를 직접 가져오려면:
Ollama를 기본 http://127.0.0.1:11434 상태로 유지하고 num_ctx 은 사용 가능한 메모리가 허용하는 범위만큼만 작은 기본값에서 높이세요. Ollama 원격 액세스를 참조하세요.

샘플링 설정

Meta는 temperature = 1.0, top_p = 0.95, top_k = 64를 권장합니다. 1.0의 온도는 많은 로컬 모델이 원하는 수준보다 높습니다. 다른 체크포인트에 적합한 0.6–0.7 범위로 낮추는 것이 여기서 출력이 저하되는 일반적인 원인입니다.

DFlash 추론 디코딩

DFlash는 주 모델이 한 번의 패스에서 검증할 수 있도록 16개의 토큰 블록을 제안하는 경량 보조 모델로, 매번 하나의 토큰만 생성하는 방식이 아닙니다. Meta의 보고에 따르면 이를 주목할 만한 것으로 만드는 것은 혁신성이 아닌 패키징입니다. 추론 디코딩은 일반적으로 호환되는 초안 모델을 소싱하고 페어링을 직접 조정하는 것을 의미합니다. 여기서는 초안 모델이 가중치와 함께 제공되며, -dflash Ollama 태그가 pull 시 이를 활성화합니다. 이는 설정에 오후를 보내야 할 속도 향상을 약 2 GB로 제공합니다. 가속은 디코딩 대상이므로 출력이 긴 경우에 가장 큰 도움이 됩니다: 에이전트 루프, 코드 생성, 그리고 high 또는 xhigh에서의 확장된 추론. 짧은 답변에는 거의 도움이 되지 않습니다. 메커니즘과 자체 하드웨어에서 이득을 측정하는 방법은 추측 디코딩을 참조하십시오.

기능

  • Controllable reasoning. Set the strength in the system prompt with Reasoning strength: low (or medium, high, xhigh). Higher settings spend more tokens before answering — raise it for hard tasks, lower it for latency.
  • 비전. 지각 인코더는 모델의 일부이며 별도 추가 기능이 아니므로, 어떤 빌드에서도 이미지 입력이 작동합니다. 출력은 텍스트만 가능합니다.
  • 에이전트 사용. 메타는 이를 끝에서 끝까지 작업 완수를 위해 훈련하고 평가했습니다: 계획, 정확한 스키마에 대한 도구 호출, 결과 확인, 그리고 실패로부터의 복구. 이는 일반 채팅 모델과는 다른 목표입니다 — 로컬 모델로 코딩 에이전트를 참조하십시오.
  • 다국어. 100+ 언어.

벤치마크

Meta-reported, on a model released today. No independent reproduction exists yet — treat these as the vendor’s claims until third-party evaluations appear. Meta는 Muse Glimmer을 Gemma 4 31B 및 Qwen3.6 27B와 에이전트, 코딩, 멀티모달, 안전성, 추론 작업 전반에서 경쟁시키며 — 동일한 크기 클래스이므로 전환하기 전에 자체 워크로드에서 비교해 보세요.

Tokios와 연결

항상 켜져 있는 로컬 에이전트는 해당 모델을 실행하는 기계에 없을 때 접근하고 싶은 에이전트입니다. Tokios는 런타임 뒤에 위치하며, 모델을 다운로드하거나 Ollama를 대체하지 않습니다.
1

로컬 런타임을 계속 실행

Ollama, LM Studio, llama.cpp 또는 vLLM에서 Muse Glimmer을 시작하고 루프백에 바인딩된 상태로 둡니다.
2

Tokios 커넥터 페어링

Sign in at tokios.com/console, open the Setup tab, and click Start pairing to get a one-time claim code (TKS-XXXX-XXXX). Run the installer on the machine that runs the model:
Windows
macOS
Linux
그런 다음 approve 장치를 Setup 또는 Connectors 탭에 연결합니다.
3

배포 등록

In the Models tab, register the upstream model id (for example muse-glimmer:30b-q4_K_M-dflash) under a public deployment name like muse-glimmer. Clients send the deployment name in the model field, never the local id — so re-quantizing later changes nothing on the client side.
4

API 키 생성

In the Keys tab, click Create key. Copy the sk-tok-… key now — it is shown only once.

어디서든 호출

주의사항

  • 벤치마크는 벤더가 보고한 값입니다. Meta는 출시 당일 이를 공개했습니다. 코딩 점수가 확정된 것으로 간주하기 전에 독립적인 평가를 기다리십시오.
  • 131,072 토큰은 목표가 아닌 상한선입니다. 긴 컨텍스트는 18 GB 가중치 위에 KV-캐시 메모리를 추가하며, 24 GB 카드에서는 DFlash drafter가 원하는 정확한 여유 공간입니다.
  • 온도 1.0이 권장 사항입니다. 테스트 없이 다른 로컬 모델의 샘플링 설정을 그대로 가져오지 마세요.
  • 비전 및 도구 호출은 런타임에 따라 다릅니다. Tokios는 이미지 콘텐츠와 도구 호출 필드를 업스트림 엔드포인트로 전달할 뿐, 런타임이나 양자화에서 누락된 기능을 추가하지 않습니다. 지원되는 백엔드를 확인하세요.
  • Apache 2.0는 Meta에게 실제적인 변화입니다. Llama 4는 허용 가능한 사용 정책과 대규모 제품에 대한 임계값이 있는 Llama 4 커뮤니티 라이선스 하에 출시됩니다. Muse Glimmer은 이러한 조건이 없지만, 이를 기반으로 구축하기 전에 라이선스를 직접 읽어보시기 바랍니다.

FAQ

18 GB for the 4-bit q4_K_M build, or 20 GB with the DFlash drafter — so a 24 GB card such as an RTX 3090 or 4090 runs it, with the remaining headroom going to KV cache. The 8-bit build needs 31 GB and BF16 needs 57 GB. The transparent calculation: 29.6B parameters × ~0.5 bytes at 4-bit ≈ 15 GB of weights, plus the vision encoder, embeddings, and overhead.
Yes. This is the headline for the release — a dense 30B agent model that is fully resident on one consumer card at 4-bit. Use muse-glimmer:30b-q4_K_M at 18 GB, or muse-glimmer:30b-q4_K_M-dflash at 20 GB if you want the speculative-decoding drafter and can spare the memory.
가중치는 Apache 2.0 라이선스 하에 공개되었으며, 이는 허용적 라이선스로 허용 가능한 사용 정책이나 사용자 수 제한이 없습니다. 이는 Llama 4에서 사용하는 Llama Community License와 차별화되는 점입니다. 오픈 가중치와 오픈 소스는 동일한 개념이 아니며, 학습 데이터와 파이프라인은 공개되지 않았습니다.
A lightweight drafter model that ships alongside Muse Glimmer. It proposes blocks of 16 tokens which the main model verifies in a single pass, rather than decoding one token at a time. Meta reports 3.1x on an RTX 5090, 1.8x on an M5 Max, and 1.5x on an M4 Max. Pull an Ollama tag ending in -dflash to get it — no separate configuration.
Meta의 자체 벤치마크는 이를 Gemma 4 31B 및 Qwen3.6 27B와 비교하며 Muse Glimmer을 선호하지만, 이러한 수치는 출시 당일 벤더가 측정한 값입니다. 모든 3는 동일한 크기 클래스에 속하며 동일한 하드웨어에서 실행되므로, 실용적인 해결책은 각 모델을 배포하여 실제 워크로드를 테스트하는 것입니다. Qwen3.6 및 Gemma를 참조하십시오.
아닙니다. 이는 Meta Superintelligence Labs의 새로운 계열로, Muse Spark라는 더 큰 교사 모델에서 증류되었으며, Llama 4와 다른 아키텍처와 다른 라이선스를 가집니다. Llama 라인은 별도로 Llama Community License를 계속 사용합니다.
시스템 프롬프트에 Reasoning strength: low, medium, high 또는 xhigh를 입력하세요. 더 높은 설정은 답변하기 전에 더 많은 토큰을 추론하는 데 사용하며, 이는 어려운 작업에 대한 품질과 지연 시간 모두를 향상시킵니다. 이는 또한 Tokios를 통해 전달되므로 API 호출의 system 메시지에서 설정하세요.
네 — 이를 위해 설계되었으며, 정확한 스키마에 대한 도구 호출과 다단계 워크플로우 전반의 오류 복구를 지원합니다. 특정 에이전트의 작동 여부는 런타임이 도구 호출을 노출하는 방식에 따라 달라집니다. 행렬은 coding agent compatibility를, 설정은 coding agents with local models을 참조하세요.

추론 디코딩

DFlash 스타일 초안 작성기의 작동 방식과 자체적으로 속도 향상을 측정하는 방법.

로컬 모델과 함께 사용하는 코딩 에이전트

Claude Code, Cline 또는 Aider를 호스팅하는 모델에 연결하세요.

어떤 GPU가 적합할까요?

VRAM 또는 통합 메모리에 맞게 모델과 컨텍스트 크기를 조정하세요.

Llama 4

Meta의 혼합 전문가(MoE) 라인업과 17B 개의 활성 파라미터가 여전히 67 GB가 필요한 이유.

휴대폰에서 접근하세요

머신에서離脱 중일 때는 항상 켜져 있는 로컬 에이전트를 사용하세요.

빠른 시작

커넥터를 페어링하고 첫 번째 모델을 엔드 투 엔드로 등록하세요.