Skip to main content
DeepSeek의 최신 오픈 웨이트 모델을 원한다면 다음부터 시작하세요: deepseek-ai/DeepSeek-V4-Flash-0731. 이 모델은 V4 Flash 프리뷰를 대체하며, 훨씬 강력한 에이전트 동작을 추가하고, low, high, max 추론 강도를 지원하며, DSpark 추측 디코딩 모듈을 번들로 포함합니다. 284B 타겟, 13B 활성 MoE로 2대의 고메모리 시스템에 분산 수용할 수 있지만, 여전히 신중한 런타임 및 메모리 계획이 필요합니다. 노트북이나 소비자용 GPU에서 DeepSeek 스타일의 추론이 필요한 경우에는 R1 distill을 대신 사용하세요. 1대의 GPU 환경이라면 말입니다. 전체 R1 및 V3 모델은 여전히 671B급 멀티 GPU 옵션입니다. 0731의 전체 하드웨어 비교 및 서빙 경로는 DeepSeek V4 Flash 0731 로컬 하드웨어를 참고하세요.

DeepSeek 제품군 개요

활성화된 파라미터 수는 생성된 토큰당 연산량에 영향을 주지만, 모든 전문가 모델을 메모리에 유지하는 데 필요한 용량은 줄이지 못합니다. 따라서 13B-active 설정의 V4 Flash 역시 캐시 및 런타임 오버헤드를 제외하고도 가중치 저장에 약 162~167 GB가 필요합니다

어떤 DeepSeek 모델을 사용해야 할까요?

  • 노트북이나 1 소비자용 GPU를 보유하고 계신가요: 먼저 R1 distill를 사용해 보세요. deepseek-r1:14b은 24 GB 용량의 GPU에서 Ollama를 활용하기에 적합한 출발점입니다. DeepSeek-R1도 참고해 보시기 바랍니다.
  • 원본 R1 추론 모델이 필요하다면: 다중 GPU 서버를 준비해야 합니다. 전체 671b 모델은 단일 워크스테이션에서 구동하기 어렵습니다
  • 일반적인 DeepSeek 기본 모델이 필요하다면: V3 시리즈는 여전히 671B급 성능을 제공하며 다중 GPU 환경에 적합합니다. 배포 계획에 맞춰 Ollama에서 V3.1 태그를 활용하되, 표준화 전에 최신 태그 정보를 확인하시기 바랍니다
  • 현재 V4 Flash 모델이 필요한 경우: deepseek-ai/DeepSeek-V4-Flash-0731을 사용하세요. 자체 호스팅은 가능하지만 하드웨어 용량만으로는 충분하지 않습니다. 로컬 하드웨어 가이드에서 런타임 성숙도를 기준으로 경로를 선택하세요.

DeepSeek-V4-Flash-0731

DeepSeek는 DeepSeek-V4-Flash-0731년 31월 2026일에 이 모델을 출시했습니다. 공식 모델 카드에 따르면 이는 프리뷰 버전을 대체하는 공식 V4 Flash 버전입니다. 이 모델은 284B을 대상으로 하는 업스트림 모델 ID를 가지며, 13B개의 전문가 모델로 구성된 혼합형 모델로 DSpark 헤드가 포함되어 있습니다. 1M 토큰 길이의 컨텍스트를 지원하며 low, high, max 수준의 추론 능력과 툴 호출 기능도 갖추고 있습니다. SGLang 측정 결과에 따르면 추가된 초안 헤드까지 포함해 약 304B개의 파라미터가 존재합니다. 가중치는 MIT 라이선스로 배포됩니다

왜 0731이 가장 적합한 배포 버전인가?

DeepSeek의 자체 에이전트 평가는 프리뷰 대비 큰 폭의 향상을 보여줍니다. 모델 카드의 보고 수치는 82.7(Terminal Bench 2.1), 54.4(DeepSWE), 70.3(Toolathlon-Verified)입니다. 해당 결과는 DeepSeek Harness 최소 모드, max 추론 강도, temperature = 1.0, top_p = 0.95를 사용한 것입니다. 정확히 평가된 설정에 대한 근거로 간주해야 하며, 로컬 처리량이나 품질을 보장하는 것은 아닙니다.
현재 정식 릴리스 버전을 평가하려는 경우 프리뷰용 저장소 deepseek-ai/DeepSeek-V4-Flash를 절대 배포해서는 안 됩니다. 대신 deepseek-ai/DeepSeek-V4-Flash-0731 버전을 고정시킨 뒤 해당 리비전을 기록해두어야 합니다.
0731 리포지토리는 Jinja 채팅 템플릿을 제공하지 않습니다. 대신 OpenAI 호환 메시지를 모델 입력으로 변환하고 완성을 파싱하는 전용 encoding 패키지를 포함합니다. 이 인코딩을 지원하는 런타임 레시피를 사용한 다음, 배포를 외부에 노출하기 전에 멀티턴 채팅, 추론 콘텐츠, 도구 호출을 테스트하세요.
다음 식별자들을 신중하게 활용해주시기 바랍니다:
Tokios의 배포란 공개적으로 사용되는 이름을 의미합니다. 이는 업스트림 모델 ID와는 별개의 개념입니다. deepseek-v4-flash을 등록해두면 클라이언트 측에서는 model 필드에 해당 이름을 입력하게 되며, 런타임 측에서는 deepseek-ai/DeepSeek-V4-Flash-0731을 서비스하게 됩니다.

Flash 모델은 GPT-5.6과 어느 정도 유사한 수준인가요?

비교 결과는 일반적인 동등성 주장이 아니라 구성에 따라 달라지는 결과로 간주하세요. Artificial Analysis는 Flash Max는 50, GPT-5.6 Sol Low는 49라고 지정된 비교에서 보고합니다. 이 결과는 Flash Max와 Low 강도 설정의 Sol을 비교한 것입니다. 더 높은 강도의 GPT-5.6 Sol이나 모든 워크로드와의 동등성을 입증하는 것은 아닙니다.

V4 Flash용 로컬 경로

각 경로마다 체크포인트 저장을 위한 디스크 공간, 임시 다운로드 및 실행 시 필요한 공간, 그리고 KV 캐시 여유분도 확보해야 합니다. 최소한 32K부터 128K까지의 컨텍스트 길이를 기준으로 계산하시기 바랍니다. 384K과 1M은 기본 설정이 아닌 별도의 튜닝 대상으로 간주해야 합니다.
이미 V4 Flash를 운영 중이라면, 헤드 노드의 루프백 인터페이스에 서비스 엔드포인트를 유지하시기 바랍니다. 해당 헤드 노드에서 1 Tokios 커넥터를 실행할 때는 오직 런타임의 /v1 엔드포인트만 지정해야 합니다. 하드웨어 가이드에 토폴로지와 배포 방식이 상세히 설명되어 있습니다.

양자화 크기에 따라 필요한 머신의 수가 결정됩니다.

Unsloth에서는 unsloth/DeepSeek-V4-Flash-0731-GGUF에서 GGUF 형식의 빌드 파일을 제공합니다. 이 크기 정보가 특히 중요하는데, 단일 머신으로 충분한지 여부를 판단하는 기준이 되기 때문입니다.

DGX Spark에서 DeepSeek-V4-Flash-0731을 배포할 수 있나요?

예, 3비트에서는 단일 유닛으로 가능합니다. Unsloth의 가이드가 UD-IQ3_XXS를 선택한 이유는 128 GB 머신에 들어가기 때문이며, NVIDIA 개발자 포럼의 보고에 의하면 단일 Spark에서 llama-server를 통해 실행했습니다. 262K 컨텍스트에서 더 작은 2비트 빌드로 실행한 사례도 포함됩니다. 하나의 Spark로는 처리할 수 없는 경우는 거의 손실 없이 빌드가 가능한 경우입니다. UD-Q4_K_XL의 크기는 155 GB이며 UD-Q8_K_XL의 크기는 162 GB로, 둘 다 128 GB를 초과합니다. 이런 경우에는 두 개의 Spark와 위 표에 명시된 풀드 메모리가 필요합니다.

Strix Halo에서 DeepSeek-V4-Flash-0731를 실행할 수 있나요?

네, 3비트 조건 하에서는 가능합니다. 128 GB 용량의 Strix Halo는 103 GB 크기의 모델을 수용할 수 있습니다. 다만 거의 무손실 수준의 빌드를 실행하려면 두 번째 장치가 필요하며, 이 경우 llama.cpp RPC를 통한 분산 처리가 이루어집니다. 이 방식은 개발자들에 의해 개념 증명용으로 소개되었습니다. 여기서 처리량은 메모리 용량이 아닌 대역폭에 의해 결정됩니다. 활성 파라미터 수가 13B개에 불과하므로 모든 284B개의 파라미터가 메모리에 상주해야 함에도 불구하고 토큰당 연산 부하는 적은 편입니다.

24 GB GPU로 DeepSeek-V4-Flash-0731을 실행할 수 있나요?

불가능합니다. 공개된 가장 작은 빌드의 크기도 92 GB이므로 어떤 양자화 수준에서도 일반 소비자용 그래픽 카드로는 감당할 수 없습니다. 게다가 시스템 RAM에 많은 파라미터를 저장하면 Flash 모델의 속도상 장점이 사라집니다. 대신 DeepSeek-R1 경량화 버전을 사용하시기 바랍니다. 이들 역시 단일 GPU에서 실행 가능하도록 설계되었습니다.

R1 및 V3 계열 모델들

V4 Flash가 이전의 모든 DeepSeek 옵션을 대체하는 것은 아닙니다. R1 distill은 소형 하드웨어에서 여전히 실용적인 선택입니다. 전체 R1 및 V3 라인은 이미 671B급 서빙 클러스터를 운영 중인 경우에 유용합니다. 디스트릴 버전의 크기, 컨텍스트 길이 및 설정 관련 조언은 DeepSeek-R1 문서를 참고하시기 바랍니다. 더 큰 모델들의 메모리 요구량을 계산하는 방법은 어떤 크기의 모델이 GPU에 적합한가? 문서를 확인해주세요.

Tokios와 DeepSeek 배포 환경을 연결하기

선택한 런타임이 정상 작동하는지 확인한 뒤, 런타임 엔드포인트가 있는 동일한 머신에 커넥터를 설치하세요. 이 커넥터는 Tokios로 연결만 수행할 뿐, 외부 접속용 포트를 제공하지 않습니다.
  1. 먼저 Setup 탭에서 커넥터를 페어링하세요. Tokios dashboard에 있는 탭입니다.
  2. 먼저 배포Models에서 등록하세요. 예를 들어 deepseek-v4-flash를 등록하고 서버가 노출하는 업스트림 모델 ID에 매핑하세요.
  3. 범위가 지정된 sk-tok-… API 키를 Keys에서 생성하세요.
  4. 이제 https://api.tokios.com/v1을 호출할 때 model에 배포 이름을 지정하세요.
V4 Flash 클러스터를 사용할 경우, 클러스터의 OpenAI 호환 /v1 엔드포인트에 접근 가능한 헤드 노드에만 커넥터를 설치하세요. 서비스 예시는 로컬 하드웨어 가이드를 참고하고, 이후 배포 환경 등록 절차를 따르시면 됩니다.

자주 묻는 질문

대략 110 GB에서 169 GB 사이의 크기인데, 다운로드하는 빌드에 따라 달라집니다. 3비트 버전인 UD-IQ3_XXS은 디스크 용량으로 103 GB를 차지하며 110에서 135 GB 정도의 메모리가 필요하므로, 단일 128 GB 통합 메모리 장비에 적합합니다. 거의 무손실 압축을 적용한 UD-Q4_K_XL은 155 GB 크기이며 무손실 압축을 적용한 UD-Q8_K_XL은 162 GB 크기인데, 둘 다 이러한 장비 여러 대가 필요합니다. 모든 284B 파라미터들은 13B 활성화된 수량과 무관하게 항상 메모리에 상주합니다.
이 모델의 가중치는 MIT 라이선스가 적용되어 있어, 이 정도 수준의 모델치고는 매우 관대한 조건이며 상업적 이용도 허용됩니다. 무료로 사용할 수 있다고 해서 무료로 실행할 수 있다는 뜻은 아닙니다. 가장 작은 규모의 빌드조차 92 GB의 용량을 차지하므로 실제 비용은 하드웨어에 달려 있습니다. 직접 호스팅을 원치 않으신다면 DeepSeek에서 제공하는 유료 호스팅 API도 이용 가능합니다.
공식 문서에 제시된 방법으로는 불가능합니다. Unsloth의 가이드에서는 분할된 GGUF 파일들을 활용해 llama.cpp에서 0731 체크포인트를 구동하도록 안내하고 있으며, 최신 버전의 llama.cpp는 V4 아키텍처도 지원합니다. 로컬 태그가 존재한다고 가정하기보다는 Ollama 라이브러리에서 현재 이용 가능한 모델을 확인해보시기 바랍니다. R1 Distill 및 DeepSeek-V3.1의 경우에는 Ollama 태그가 존재하니 DeepSeek-R1를 참고해주세요.
규모와 용도의 차이입니다. V4 Flash는 현재 출시된 284B 혼합형 전문가 모델로, 1M 토큰 분량의 컨텍스트를 처리할 수 있어 128 GB 이상의 메모리를 갖춘 기기에서 에이전트 작업이나 코딩에 활용하기 적합합니다. 반면 R1 Distill은 소형 밀집형 모델로 단일 소비자용 GPU에서도 구동 가능하지만 기능 면에서는 제약이 있습니다. 만약 사용 중인 하드웨어가 24 GB 용량의 GPU라면 Distill이야말로 양자 중에서 실행 가능한 유일한 모델입니다.
로컬에서 서빙한 다음, 런타임이 있는 머신에서 Tokios 커넥터를 페어링하세요. 클러스터라면 헤드 노드에서만 페어링합니다. 커넥터는 외부로 연결을 맺으므로 GPU가 있는 장비에는 인바운드 포트가 필요 없습니다. 이후 클라이언트는 https://api.tokios.com/v1sk-tok-… 키와 함께 호출하며, model 필드에는 배포 이름을 넣습니다.

V4 Flash 실행에 필요한 로컬 하드웨어 사양

2대의 RTX PRO 6000, 2대의 DGX Spark, 2대의 Strix Halo 시스템을 비교합니다.

DeepSeek-R1

하드웨어 사양이 제한적인 경우 R1 추론용 Distill 모델을 선택해 실행해보세요.

작업별로 적합한 모델을 선택하기

추론, 코딩, 그리고 에이전트 작업에 적합한 로컬 모델들을 비교해보세요.

사용 중인 GPU에 가장 적합한 모델을 선택하세요.

모델의 가중치, 캐시, 그리고 양자화에 필요한 메모리 요구사항을 파악해보세요.