Skip to main content
You can self-host deepseek-ai/DeepSeek-V4-Flash-0731, the official release that supersedes the V4 Flash preview. The answer depends on more than aggregate memory. The 284B target model activates 13B parameters per token. Its bundled DSpark draft head raises the full checkpoint count to about 304B parameters. The published serving formats still need roughly 162–167 GB of resident weights before KV cache, temporary buffers, and the operating system. The 3 configurations below can meet that floor. They do not have the same software maturity. 실질적인 권장사항은 간단합니다: 우선 32K–128K 컨텍스트 수준에서 실행해보고 안정적인 생성 및 툴 호출이 가능한지 확인한 뒤 캐시 용량을 측정해보는 것입니다. 384K과 1M은 별개의 엔지니어링 목표로 간주해야 합니다. 해당 모델은 1M 토큰 규모의 컨텍스트 윈도우를 지원한다고 명시되어 있으나, 모든 로컬 환경에서 1M 토큰 규모의 캐시를 확보할 수 있다는 의미는 아닙니다.

어떤 구성이 적합하며, 어느 정도 신뢰도를 가질 수 있을까?

검증 완료란 해당 소프트웨어나 모델의 공식 문서에 정확한 경로가 명시되어 있음을 의미합니다. 커뮤니티 검증 필요란 관련 런타임 경로와 성능 수치는 문서화되어 있으나, 특정 체크포인트와 하드웨어 조합이 아직 공개적으로 재현되지 않았음을 뜻합니다. 커뮤니티 테스트 완료는 일반 사용자들이 해당 방식을 보고했으나 직접 본인의 환경에서 재현해야 함을 의미합니다. 실험 단계는 업스트림 프로젝트 자체에서 해당 방식이 실제 배포용으로 적합하지 않다고 경고하고 있음을 나타냅니다.

먼저 메모리 계산부터 시작하세요

The official model card describes the 284B target model, 13B active parameters per token, and the attached DSpark speculative-decoding module. SGLang’s current hardware matrix counts about 304B parameters for the complete 0731 checkpoint. The active count helps explain compute cost. It does not tell you how much model state must be resident:
For a concrete downloadable format, Unsloth lists a lossless GGUF release at about 162 GB. Other serving formats are closer to 167 GB once their fused weights and metadata are counted. That is the weight floor, not a deployment recommendation.
Do not treat 192 GB as 192 GB available to V4 Flash. Two 96 GB GPUs clear the weight floor, but leave limited room for KV cache and runtime allocations. A successful model load is not yet a usable deployment.

2개의 RTX PRO 6000 Blackwell GPU

NVIDIA lists the RTX PRO 6000 Blackwell with 96 GB of GDDR7 memory and 1,792 GB/s memory bandwidth per card in its product specifications. Two cards give 192 GB of VRAM, enough to hold the published weight formats in principle. SGLang documents tensor parallelism of 2 for the earlier Flash checkpoint in its DeepSeek V4 guide. Its 0731 validation list covers larger 4–8 GPU configurations, not this exact 2-GPU setup. Call this path Community validation required, not verified.

권장 절차 순서

  1. 선택한 런타임 환경에서 두 GPU가 모두 인식되는지 확인하세요
  2. 처음에는 32K 수준의 컨텍스트 제한과 한 번에 1개의 요청만 처리해보세요
  3. VRAM 사용량, 첫 번째 토큰 생성 지연 시간 및 처리 안정성을 측정한 뒤에야 128K 수준으로 설정을 높이는 것이 좋습니다
  4. 만약 384K 또는 1M이 필요하다면, 전체 VRAM에서 가중치를 일일이 빼내는 대신 실제 사용량을 측정하여 KV 캐시 크기를 결정하시기 바랍니다.
커뮤니티 검증 완료 — 이전 Flash TP=2 기준값을 참고하세요. SGLang 가이드에 명시된 버전에 맞춰 업스트림 모델 ID와 플래그 설정을 조정해야 합니다. 이는 공식적인 0731 검증 절차가 아닌 시작용 예시일 뿐입니다.
명령어를 사용하기 전에 인수 이름과 지원되는 양자화 방식이 현재 설치된 SGLang 버전과 일치하는지 확인하세요. 체크포인트, 컨테이너, 드라이버, 워크스테이션 구조 모두 TP=2 성공 여부에 영향을 미칩니다.

2개의 DGX Spark 장치

Each DGX Spark has 128 GB of LPDDR5x unified memory and 273 GB/s memory bandwidth. NVIDIA documents a ConnectX-7 clustering path for 2 systems in its Spark stacking guide, and lists the hardware details in its DGX Spark overview. This gives 256 GB of aggregate memory, which is meaningfully less tight than 192 GB for weight plus cache capacity. 이 역시 네트워크 기반 분산 런타임입니다. NVIDIA는 클러스터 구조에 관해 설명할 뿐 공식적인 0731 DeepSeek 구현 가이드는 제공하지 않습니다. 2 Sparks 관련 커뮤니티 보고서는 이전 Flash 체크포인트를 기준으로 작성되었습니다. 0731 환경으로 전환한 후에는 모델 로드, 생성 작업, 툴 호출 및 지속적 요청 처리 기능을 재검증해야 합니다.

권장되는 토폴로지 구조

Tokios 커넥터는 헤드 노드에만 필요합니다. 이 커넥터는 워커 노드나 클러스터 구조가 아닌 헤드 노드의 로컬 OpenAI 호환 /v1 엔드포인트를 가리켜야 합니다. 커뮤니티 검증 완료 — 듀얼 Spark 기반 시작 예시입니다. 먼저 NVIDIA의 2-Spark 네트워킹 설정을 완료한 뒤, 현재 설치된 버전을 지원하는 분산 런타임 절차를 활용하여 32K 컨텍스트부터 작업을 시작하세요. 미리보기용 체크포인트 명령어를 공식적인 0731 구현 가이드로 오해해서는 안 됩니다.
NVIDIA는 고속 연결망을 ConnectX-7 클러스터 링크라 부릅니다. 이는 단일 카드 기반 NVLink 스타일 메모리 풀을 대체할 수 없으며, 런타임은 여전히 작업을 분할하여 노드 간 통신을 수행합니다. 프롬프트 크기에 따른 처리량과 지연 시간을 직접 측정해보시기 바랍니다.

2개의 Strix Halo 장치

AMD lists the Ryzen AI Max+ 395 with up to 128 GB of unified memory in its processor specifications. Two fully provisioned systems have enough aggregate capacity for the 162 GB GGUF weight release. 문제는 분산형 서빙 레이어에 있습니다. 현재 사용 가능한 경로는 llama.cpp RPC입니다. 해당 업스트림 RPC README에서는 이 RPC를 개념 증명용 수단으로 설명하면서 불안정하고 보안상 취약하다고 경고하고 있습니다. 따라서 이는 실제 생산 환경에 적용할 수 있는 아키텍처라기보다는 실험적 성격의 역량 시연에 불과합니다. 실험적 단계 — llama.cpp RPC 구조. RPC 워커는 반드시 신뢰할 수 있는 사내 네트워크에서만 실행해야 합니다. llama.cpp 빌드 버전마다 바이너리 명칭과 실행 플래그가 달라지므로, 사용 중인 버전에 맞는 명령어는 업스트림 README를 참고하시기 바랍니다.
절대로 RPC 리스너를 공개 인터넷에 개방해서는 안 됩니다. 모델이 정상적으로 로드된다고 해서 해당 RPC 경로가 생산 환경에 적합하다고 단정해서는 안 됩니다. 안정적인 서비스를 원한다면 문서화된 분산형 서빙 모델을 제공하는 런타임을 활용하시기 바랍니다.

비교 기준으로 삼을 수 있는 공식 기준치들입니다.

하드웨어 사양이 낮은 환경에서도 동일한 지원 수준이 보장된다고 오해하지 말고, 벤더 및 런타임 예시를 통해 기대치를 설정하시기 바랍니다. 검증 완료 — 현재 0731 vLLM 기준 사양입니다. 공식 모델 설명서에서는 4× GB300 용량, 전문가 병렬 처리, FP8 방식의 KV 캐시, 그리고 DSpark 모듈을 활용하도록 명시하고 있습니다.
에이전트 기반 워크로드의 경우 DeepSeek에서는 temperature = 1.0top_p = 0.95 설정을 권장합니다. 이러한 샘플링 설정은 서버 실행 시 사용되는 플래그와 별개로 관리해야 하며, 반드시 자체 에이전트 환경에서 검증해야 합니다.

다음 순서에 따라 검증을 진행하십시오.

  1. 정확한 체크포인트 파일을 다운로드한 뒤 그 버전 정보를 기록해두세요.
  2. Load it with 32K context and 1 concurrent request.
  3. 워크로드에 도구 활용이 필요하다면 짧은 채팅 요청, 긴 프롬프트, 그리고 도구 호출 요청까지 순차적으로 전송해보세요.
  4. 메모리 사용량, 첫 번째 토큰 생성까지 걸리는 시간, 생성 속도 및 오류 발생 여부를 모두 기록하십시오.
  5. 컨텍스트 크기를 128K 수준으로 높인 뒤 동일한 워크로드를 다시 실행해보세요.
  6. 이제서야 KV 캐시 용량 제한 및 롤백 계획을 고려하여 384K 또는 1M 설정을 테스트할 수 있습니다.
이러한 순서를 지키면 가중치 호환성 문제와 캐시 부하, 분산 처리 시 통신 문제, 도구 형식 관련 문제들을 명확히 구분할 수 있습니다. 또한 공개된 최대 컨텍스트 크기가 실제 운영 환경에서 검증되지 않은 기대치로 남는 상황도 방지할 수 있습니다.

Tokios를 통해 헤드 노드를 외부에 노출시키세요.

Tokios는 1 안정적인 OpenAI 호환 업스트림 모델 엔드포인트가 필요합니다. 클러스터 환경에서는 모든 워커가 아닌 헤드 노드에만 그러한 엔드포인트가 존재합니다.
1

헤드 노드에 위치한 모델 서버는 외부에 노출되지 않도록 설정해야 합니다.

헤드 노드의 루프백 /v1 엔드포인트, 예컨대 http://127.0.0.1:8000/v1에서 모델 서빙 프로세스가 정상적으로 응답하는지 확인하십시오. 클러스터 내 워커 간 통신은 클러스터 네트워크를 통해 이루어져야 합니다.
2

헤드 노드에 1 커넥터를 설치합니다.

In the Tokios dashboard, open Setup and select Start pairing. Install and run tokios-connector on the head node. The connector dials out; it does not require an inbound port.
3

헤드 노드의 업스트림 설정을 완료합니다.

커넥터의 BaseUrl 값을 헤드 노드의 로컬 /v1 엔드포인트로 지정하십시오. 전체 설정 형식은 커넥터 설정 문서를 참고하시기 바랍니다.
4

공개 배포 환경을 등록합니다.

In Models, register a deployment such as deepseek-v4-flash. Map it to the upstream model id your head-node server exposes. Clients send the deployment name, not the Hugging Face id.
5

범위가 지정된 API 키를 생성합니다.

Create an sk-tok-… key in Keys, optionally scoped to deepseek-v4-flash. Clients then call https://api.tokios.com/v1.
검증 완료 — Tokios API 요청. 이 단계에서는 로컬 클러스터가 정상 작동하는지 확인한 뒤 Tokios의 OpenAI 호환 엔드포인트를 테스트합니다.
이 명령어는 특정 DeepSeek 클러스터가 정상 작동하는지 확인하지 않습니다. 먼저 로컬 검증을 수행해보시기 바랍니다.

DeepSeek 제품군 개요

V4 Flash와 R1 distills, 그리고 V3 시리즈를 서로 비교해보세요.

vLLM 원격 접속 방법

vLLM /v1 엔드포인트는 반드시 비공개 상태로 유지하고 Tokios를 통해 접근해야 합니다.

DGX Spark

커넥터를 활용하여 DGX Spark를 설정하고 사용하는 방법입니다.

RTX 워크스테이션

RTX 기반의 로컬 추론용 머신을 선택하고 설정하는 절차입니다.