deepseek-ai/DeepSeek-V4-Flash-0731, the official release that supersedes the V4 Flash preview. The answer depends on more than aggregate memory. The 284B target model activates 13B parameters per token. Its bundled DSpark draft head raises the full checkpoint count to about 304B parameters. The published serving formats still need roughly 162–167 GB of resident weights before KV cache, temporary buffers, and the operating system. The 3 configurations below can meet that floor. They do not have the same software maturity.
실질적인 권장사항은 간단합니다: 우선 32K–128K 컨텍스트 수준에서 실행해보고 안정적인 생성 및 툴 호출이 가능한지 확인한 뒤 캐시 용량을 측정해보는 것입니다. 384K과 1M은 별개의 엔지니어링 목표로 간주해야 합니다. 해당 모델은 1M 토큰 규모의 컨텍스트 윈도우를 지원한다고 명시되어 있으나, 모든 로컬 환경에서 1M 토큰 규모의 캐시를 확보할 수 있다는 의미는 아닙니다.
어떤 구성이 적합하며, 어느 정도 신뢰도를 가질 수 있을까?
검증 완료란 해당 소프트웨어나 모델의 공식 문서에 정확한 경로가 명시되어 있음을 의미합니다. 커뮤니티 검증 필요란 관련 런타임 경로와 성능 수치는 문서화되어 있으나, 특정 체크포인트와 하드웨어 조합이 아직 공개적으로 재현되지 않았음을 뜻합니다. 커뮤니티 테스트 완료는 일반 사용자들이 해당 방식을 보고했으나 직접 본인의 환경에서 재현해야 함을 의미합니다. 실험 단계는 업스트림 프로젝트 자체에서 해당 방식이 실제 배포용으로 적합하지 않다고 경고하고 있음을 나타냅니다.
먼저 메모리 계산부터 시작하세요
The official model card describes the 284B target model, 13B active parameters per token, and the attached DSpark speculative-decoding module. SGLang’s current hardware matrix counts about 304B parameters for the complete 0731 checkpoint. The active count helps explain compute cost. It does not tell you how much model state must be resident:2개의 RTX PRO 6000 Blackwell GPU
NVIDIA lists the RTX PRO 6000 Blackwell with 96 GB of GDDR7 memory and 1,792 GB/s memory bandwidth per card in its product specifications. Two cards give 192 GB of VRAM, enough to hold the published weight formats in principle. SGLang documents tensor parallelism of 2 for the earlier Flash checkpoint in its DeepSeek V4 guide. Its 0731 validation list covers larger 4–8 GPU configurations, not this exact 2-GPU setup. Call this path Community validation required, not verified.권장 절차 순서
- 선택한 런타임 환경에서 두 GPU가 모두 인식되는지 확인하세요
- 처음에는 32K 수준의 컨텍스트 제한과 한 번에 1개의 요청만 처리해보세요
- VRAM 사용량, 첫 번째 토큰 생성 지연 시간 및 처리 안정성을 측정한 뒤에야 128K 수준으로 설정을 높이는 것이 좋습니다
- 만약 384K 또는 1M이 필요하다면, 전체 VRAM에서 가중치를 일일이 빼내는 대신 실제 사용량을 측정하여 KV 캐시 크기를 결정하시기 바랍니다.
2개의 DGX Spark 장치
Each DGX Spark has 128 GB of LPDDR5x unified memory and 273 GB/s memory bandwidth. NVIDIA documents a ConnectX-7 clustering path for 2 systems in its Spark stacking guide, and lists the hardware details in its DGX Spark overview. This gives 256 GB of aggregate memory, which is meaningfully less tight than 192 GB for weight plus cache capacity. 이 역시 네트워크 기반 분산 런타임입니다. NVIDIA는 클러스터 구조에 관해 설명할 뿐 공식적인 0731 DeepSeek 구현 가이드는 제공하지 않습니다. 2 Sparks 관련 커뮤니티 보고서는 이전 Flash 체크포인트를 기준으로 작성되었습니다. 0731 환경으로 전환한 후에는 모델 로드, 생성 작업, 툴 호출 및 지속적 요청 처리 기능을 재검증해야 합니다.권장되는 토폴로지 구조
/v1 엔드포인트를 가리켜야 합니다.
커뮤니티 검증 완료 — 듀얼 Spark 기반 시작 예시입니다. 먼저 NVIDIA의 2-Spark 네트워킹 설정을 완료한 뒤, 현재 설치된 버전을 지원하는 분산 런타임 절차를 활용하여 32K 컨텍스트부터 작업을 시작하세요. 미리보기용 체크포인트 명령어를 공식적인 0731 구현 가이드로 오해해서는 안 됩니다.
NVIDIA는 고속 연결망을 ConnectX-7 클러스터 링크라 부릅니다. 이는 단일 카드 기반 NVLink 스타일 메모리 풀을 대체할 수 없으며, 런타임은 여전히 작업을 분할하여 노드 간 통신을 수행합니다. 프롬프트 크기에 따른 처리량과 지연 시간을 직접 측정해보시기 바랍니다.
2개의 Strix Halo 장치
AMD lists the Ryzen AI Max+ 395 with up to 128 GB of unified memory in its processor specifications. Two fully provisioned systems have enough aggregate capacity for the 162 GB GGUF weight release. 문제는 분산형 서빙 레이어에 있습니다. 현재 사용 가능한 경로는 llama.cpp RPC입니다. 해당 업스트림 RPC README에서는 이 RPC를 개념 증명용 수단으로 설명하면서 불안정하고 보안상 취약하다고 경고하고 있습니다. 따라서 이는 실제 생산 환경에 적용할 수 있는 아키텍처라기보다는 실험적 성격의 역량 시연에 불과합니다. 실험적 단계 — llama.cpp RPC 구조. RPC 워커는 반드시 신뢰할 수 있는 사내 네트워크에서만 실행해야 합니다. llama.cpp 빌드 버전마다 바이너리 명칭과 실행 플래그가 달라지므로, 사용 중인 버전에 맞는 명령어는 업스트림 README를 참고하시기 바랍니다.비교 기준으로 삼을 수 있는 공식 기준치들입니다.
하드웨어 사양이 낮은 환경에서도 동일한 지원 수준이 보장된다고 오해하지 말고, 벤더 및 런타임 예시를 통해 기대치를 설정하시기 바랍니다.
검증 완료 — 현재 0731 vLLM 기준 사양입니다. 공식 모델 설명서에서는 4× GB300 용량, 전문가 병렬 처리, FP8 방식의 KV 캐시, 그리고 DSpark 모듈을 활용하도록 명시하고 있습니다.
temperature = 1.0 및 top_p = 0.95 설정을 권장합니다. 이러한 샘플링 설정은 서버 실행 시 사용되는 플래그와 별개로 관리해야 하며, 반드시 자체 에이전트 환경에서 검증해야 합니다.
다음 순서에 따라 검증을 진행하십시오.
- 정확한 체크포인트 파일을 다운로드한 뒤 그 버전 정보를 기록해두세요.
- Load it with 32K context and 1 concurrent request.
- 워크로드에 도구 활용이 필요하다면 짧은 채팅 요청, 긴 프롬프트, 그리고 도구 호출 요청까지 순차적으로 전송해보세요.
- 메모리 사용량, 첫 번째 토큰 생성까지 걸리는 시간, 생성 속도 및 오류 발생 여부를 모두 기록하십시오.
- 컨텍스트 크기를 128K 수준으로 높인 뒤 동일한 워크로드를 다시 실행해보세요.
- 이제서야 KV 캐시 용량 제한 및 롤백 계획을 고려하여 384K 또는 1M 설정을 테스트할 수 있습니다.
Tokios를 통해 헤드 노드를 외부에 노출시키세요.
Tokios는 1 안정적인 OpenAI 호환 업스트림 모델 엔드포인트가 필요합니다. 클러스터 환경에서는 모든 워커가 아닌 헤드 노드에만 그러한 엔드포인트가 존재합니다.1
헤드 노드에 위치한 모델 서버는 외부에 노출되지 않도록 설정해야 합니다.
헤드 노드의 루프백
/v1 엔드포인트, 예컨대 http://127.0.0.1:8000/v1에서 모델 서빙 프로세스가 정상적으로 응답하는지 확인하십시오. 클러스터 내 워커 간 통신은 클러스터 네트워크를 통해 이루어져야 합니다.2
헤드 노드에 1 커넥터를 설치합니다.
In the Tokios dashboard, open Setup and select Start pairing. Install and run
tokios-connector on the head node. The connector dials out; it does not require an inbound port.3
헤드 노드의 업스트림 설정을 완료합니다.
커넥터의
BaseUrl 값을 헤드 노드의 로컬 /v1 엔드포인트로 지정하십시오. 전체 설정 형식은 커넥터 설정 문서를 참고하시기 바랍니다.4
공개 배포 환경을 등록합니다.
In Models, register a deployment such as
deepseek-v4-flash. Map it to the upstream model id your head-node server exposes. Clients send the deployment name, not the Hugging Face id.5
범위가 지정된 API 키를 생성합니다.
Create an
sk-tok-… key in Keys, optionally scoped to deepseek-v4-flash. Clients then call https://api.tokios.com/v1.DeepSeek 제품군 개요
V4 Flash와 R1 distills, 그리고 V3 시리즈를 서로 비교해보세요.
vLLM 원격 접속 방법
vLLM
/v1 엔드포인트는 반드시 비공개 상태로 유지하고 Tokios를 통해 접근해야 합니다.DGX Spark
커넥터를 활용하여 DGX Spark를 설정하고 사용하는 방법입니다.
RTX 워크스테이션
RTX 기반의 로컬 추론용 머신을 선택하고 설정하는 절차입니다.