Q4-class download is ~67 GB, Maverick’s is ~245 GB. Run the one that fits your hardware, then pair the Tokios connector to reach it as https://api.tokios.com from any OpenAI- or Anthropic-compatible client.
Meta의 모델 개발은 Muse 라인으로 이동했습니다 — 비공개 가중치의 Muse Spark와 공개 가중치의 Muse Glimmer 30B입니다. Meta는 Llama를 공식적으로 단종하지 않았으며 가중치는 계속 다운로드할 수 있지만, Llama 5는 발표되지 않았습니다.
변형 및 태그
아래의 모든 값은 Ollama 라이브러리와 Meta의 Hugging Face 모델 카드에서 가져온 것입니다. 태그와 크기는 새로운 양자화가 출시됨에 따라 변경되므로, 하나로 표준화하기 전에 ollama.com/library/llama4에서 확인하세요.
출처 ollama.com/library/llama4/tags, Meta의 Llama 4 발표, meta-llama/Llama-4-Scout-17B-16E-Instruct.
세 번째 모델인 Llama 4 Behemoth(약 2T 파라미터)는 이 제품군의 티처 모델로 미리 공개되었지만 공개적으로 출시되지는 않았습니다. Scout와 Maverick만 다운로드할 수 있습니다.
왜 “17B active”는 여전히 67 GB가 필요한가요?
MoE 라우팅은 토큰당 17B개의 매개변수를 활성화하지만, 라우터는 토큰마다 다른 전문가 하위 집합을 선택하므로 모든 전문가 가중치를 로드된 상태로 유지해야 합니다. 메모리 계산은 활성 매개변수가 아니라 전체 매개변수에 기반합니다.- Scout의 경우 109B × 약 0.5 바이트,
Q4급에서 ≈ 55 GB의 가중치, 오버헤드를 포함해 출하 시 약 67 GB - Maverick의 경우 400B × ~0.5 바이트 ≈ 200 GB의 가중치, ~245 GB 출하 시
하드웨어 적합성
적당한 컨텍스트 길이에서는 대략Q4 정도에서 쾌적하게 사용할 수 있습니다. 모든 항목을 추정치로 취급하세요. 실제 기준은 다운로드 크기에 해당 컨텍스트의 KV 캐시를 더한 값이며, 장기 컨텍스트의 주요 수치(Scout의 경우 10M)는 KV 캐시 메모리를 대부분의 머신이 보유한 용량을 훨씬 넘어서도록 증가시킵니다. 크기 계산은 어떤 크기의 모델이 GPU에 맞나요?를 참조하세요.
실행되면 하나의 엔드포인트에서 서빙하세요
Llama 4 배포를 Tokios에 등록하고
sk-tok-… 키가 있는 모든 머신에서 호출하세요 — GPU를 보유한 상자에 인바운드 포트가 필요 없습니다.실행하기 — 초급부터 고급까지
- Ollama (가장 쉬움)
- vLLM (다중 GPU)
http://127.0.0.1:11434에서 수신 대기 상태로 두세요. 긴 컨텍스트를 사용하려면 num_ctx를 Ollama의 작은 기본값보다 높이세요 — 하지만 10M 헤드라인이 아니라 여유 메모리에 맞춰 크기를 정하세요.기능
- 다중 모드 입력 - Scout와 Maverick은 텍스트와 이미지를 기본적으로 지원하며, 출력은 텍스트 전용입니다.
- Context: Scout advertises a 10M-token window and Maverick 1M. Serving anywhere near those lengths is a KV-cache memory problem of its own — see KV cache and context before you plan around them.
- 언어 메타의 모델 카드는 12개의 지원 언어를 나열하며, 영어, 독일어, 프랑스어, 스페인어, 포르투갈어, 힌디어, 베트남어가 포함됩니다.
- Reasoning: 일반 instruction-tuned 모델 — 별도의 thinking 모드 없음. 단계별 추론 출력은 DeepSeek 또는 gpt-oss를 참조하세요.
Tokios와 연결하세요
1
로컬 런타임을 계속 실행 상태로 유지하세요.
Llama 4을 Ollama, vLLM 또는 다른 OpenAI 호환 런타임에서 시작하고 루프백에 바인딩된 상태로 두세요.
2
Tokios 커넥터 페어링
로그인은 tokios.com/console에서 하고, Setup 탭을 열고, Start pairing를 클릭하여 일회용 클레임 코드(그런 다음 approve을(를) Setup 또는 Connectors 탭의 기기에서 실행하세요.
TKS-XXXX-XXXX)를 받으세요. 모델을 실행하는 머신에서 설치 프로그램을 실행하세요.Windows
macOS
Linux
3
배포를 등록하세요
해당 Models 탭에서 업스트림 모델 ID(예:
llama4:scout)를 llama4-tunnel와 같은 공개 배포 이름으로 등록합니다. 클라이언트는 model 필드에 배포 이름을 보내며, 로컬 ID는 절대 보내지 않습니다.4
API 키를 생성하고 이름을 지정하세요.
In the Keys tab, click Create key, then:
주의사항
- No consumer-GPU path. Unlike the 3.x line, neither Llama 4 model fits a 24–48 GB card in VRAM. llama.cpp-based runtimes can offload experts to system RAM, but throughput drops sharply once weights leave the GPU — budget for unified memory or a server before you standardize on Llama 4.
- 라이선스 Llama 4은 Meta의 Llama 4 Community License 를 사용합니다. Apache나 MIT가 아닙니다. 이 라이선스에는 허용 사용 정책과 월간 활성 사용자가 700백만 명 이상인 제품에 대한 별도의 Meta 라이선스 요건이 포함되어 있습니다. 상업적 사용 전에 확인하세요.
- 긴 컨텍스트는 메모리 예산이지 무료 기능이 아닙니다. 전체 점유 상태의 10M-토큰 창은 가중치 메모리 용량을 훨씬 초과하는 KV 캐시가 필요합니다. 실제 메모리에 맞게
num_ctx/--max-model-len로 크기를 조정하세요. - Tokios는 이미지 콘텐츠와 도구 호출 필드를 업스트림 런타임으로 그대로 전달합니다. 즉, 런타임이나 양자화가 지원하지 않는 기능을 추가하지 않습니다.
Muse Glimmer
Meta의 현재 오픈 가중치 라인 — Apache 2.0, 에이전트형, 그리고 단일 24 GB 카드에 적합합니다.
GPU에 무엇이 맞을까요?
다운로드하기 전에 모델을 VRAM 또는 통합 메모리에 맞게 크기를 조정하세요.
양자화 및 하드웨어
GPU, Mac 또는 통합 메모리 장치에서 어떤 가중치 형식이 실행되는지.
빠른 시작
커넥터를 페어링하고 첫 번째 모델을 처음부터 끝까지 등록하세요.