Skip to main content
您可自行部署 deepseek-ai/DeepSeek-V4-Flash-0731,这是正式版发布内容,取代了原先的 V4 Flash 预览版。实际可行性并不仅仅取决于内存总量。该 284B 目标模型在生成每个令牌时需调用 13B 个参数。其配套的 DSpark 草稿生成模块更使完整模型参数总量升至约 304B 个。即便如此,在预留 KV 缓存、临时缓冲区及操作系统所需空间后,所需模型权重存储量仍约为 162 至 167 GB。下文所列 3 种配置均可满足这一最低要求,不过其软件环境成熟度各异。 实际操作建议十分简单:先设定 32K 至 128K 个上下文长度进行测试,确认生成过程与工具调用均稳定无误后再测算缓存容量。请将 384K 与 1M 视作两个独立的工程指标。该模型标称支持 1M 个令牌的上下文窗口,但这并不代表所有本地配置都能预留出同等容量的 1M 令牌缓存空间。

哪些配置切实可行?用户又该抱有多大的信心呢?

已验证意味着相关软件或模型文档中明确记载了对应的路径。需社区验证则表示相关运行环境及路径虽有记录,但该特定检查点与硬件组合尚未经公开验证。社区测试通过意味着已有用户成功实践过该方法,不过你仍需在自己的环境中复现。实验性则指上游项目本身已提示该方案尚不适合投入生产使用。

首先进行内存需求计算。

The official model card describes the 284B target model, 13B active parameters per token, and the attached DSpark speculative-decoding module. SGLang’s current hardware matrix counts about 304B parameters for the complete 0731 checkpoint. The active count helps explain compute cost. It does not tell you how much model state must be resident:
就可下载的格式而言,Unsloth 提供了无损压缩的 GGUF 版本,其大小约为 162 GB。若计入融合后的权重与元数据,其他服务格式的大小则接近 167 GB。此数值仅为最低存储需求,并非部署时的推荐配置。
Do not treat 192 GB as 192 GB available to V4 Flash. Two 96 GB GPUs clear the weight floor, but leave limited room for KV cache and runtime allocations. A successful model load is not yet a usable deployment.

2 块 RTX PRO 6000 Blackwell 显卡

NVIDIA lists the RTX PRO 6000 Blackwell with 96 GB of GDDR7 memory and 1,792 GB/s memory bandwidth per card in its product specifications. Two cards give 192 GB of VRAM, enough to hold the published weight formats in principle. SGLang documents tensor parallelism of 2 for the earlier Flash checkpoint in its DeepSeek V4 guide. Its 0731 validation list covers larger 4–8 GPU configurations, not this exact 2-GPU setup. Call this path Community validation required, not verified.

推荐操作步骤

  1. 确认所选运行时环境能够识别两块显卡。
  2. 初始阶段建议将上下文长度设为 32K,每次仅处理 1 个请求。
  3. 在充分统计显存占用情况、首字生成延迟及运行稳定性后,再逐步将数值提升至 128K 水平。
  4. 若您需要 384K 或 1M,建议依据实际使用量来设定 KV 缓存大小,而无需手动从总显存容量中扣除权重所占空间。
经社区验证——早期 Flash TP=2 基准测试。 请依据 SGLang 指南中所列的版本信息来设定具体的上游模型 ID 及相关参数。此配置仅为初始参考范例,并非官方认可的 0731 验证方案。
在运行相关命令前,请先对比其参数名称及所支持的量化方式是否与您当前安装的 SGLang 版本相符。检查点文件、容器环境、驱动程序以及工作站硬件架构均会影响 TP=2 部署的成败。

2 台 DGX Spark 设备

Each DGX Spark has 128 GB of LPDDR5x unified memory and 273 GB/s memory bandwidth. NVIDIA documents a ConnectX-7 clustering path for 2 systems in its Spark stacking guide, and lists the hardware details in its DGX Spark overview. This gives 256 GB of aggregate memory, which is meaningfully less tight than 192 GB for weight plus cache capacity. 该架构本质上仍属基于网络的分布式运行环境。NVIDIA 仅提供了集群互联相关说明,并未发布官方版的 0731 DeepSeek 部署方案。目前社区针对 2 Sparks 系统的测试均基于早期 Flash 版本检查点展开。迁移至 0731 版本后,请务必重新验证模型加载、推理生成、工具调用及持续请求处理能力。

推荐的硬件拓扑结构

仅主节点需安装 Tokios 连接器。该连接器须指向主节点本地提供的 OpenAI 兼容 /v1 接口,而不可直接连接至工作节点或集群互联网络。 经社区验证——双 Spark 系统初始配置范例。 首先请完成 NVIDIA 指定的 2-Spark 集群网络配置流程。随后选用明确适配您当前版本环境的分布式运行方案,并从 32K 上下文长度设置开始部署。切勿将预览版检查点命令视作官方发布的 0731 部署方案。
NVIDIA 将此类高速互联方式称为 ConnectX-7 集群链路。需特别说明的是,该链路无法替代单卡环境下的 NVLink 式内存共享机制:运行时系统仍须将任务拆分并在各节点间传递数据。建议依据实际提示词长度来测试系统吞吐量及延迟表现。

2 台 Strix Halo 设备

AMD lists the Ryzen AI Max+ 395 with up to 128 GB of unified memory in its processor specifications. Two fully provisioned systems have enough aggregate capacity for the 162 GB GGUF weight release. 问题在于分布式服务层。目前可用的方案是 llama.cpp RPC。其 上游 RPC 说明文档 指出该方案仅属概念验证性质,并警示其稳定性较差且安全性不足。因此这仅能视作一个 实验性 的能力演示,绝非可投入生产的架构。 实验性质 — llama.cpp RPC 架构。 仅应在受信任的私有网络内运行 RPC 工作进程。由于不同版本的 llama.cpp 对应的二进制文件名与启动参数各异,请务必参照上游文档以获取适配您所用版本的命令指令。
切勿将 RPC 监听端口直接暴露在公网环境中。即便模型能够成功加载,也不可贸然将其视作生产级服务。若需构建稳定的生产级服务,建议选用具备成熟分布式服务架构说明文档的运行环境。

可供参考的官方基准数据

请参考各厂商提供的运行实例来设定预期值,切勿据此认定硬件配置较低的设备也能获得同等程度的支持。 验证通过 — 当前 0731 版本的 vLLM 参考标准。 官方模型说明文档中提及需使用容量为 4× GB300 的设备,同时需启用专家并行机制、FP8 格式的 KV 缓存以及随附的 DSpark 模块。
针对基于智能体的工作负载,DeepSeek 推荐选用 temperature = 1.0top_p = 0.95 配置。请务必将相关采样参数与服务器启动参数区分开来,并通过智能体测试工具验证其效果。

请按如下顺序执行验证流程

  1. 下载对应的检查点文件并记录其版本信息。
  2. 在设定为 32K 的上下文长度及 1 并发请求量的条件下加载该检查点。
  3. 发送简短对话请求、长文本输入请求,若工作负载涉及工具调用,还需发送工具调用请求。
  4. 记录内存占用情况、首个令牌生成延迟、生成速率以及任何错误信息。
  5. 将上下文长度提升至 128K 后再重复执行上述工作负载测试。
  6. 完成上述步骤后方可测试 384K 或 1M 配置,同时需设定 KV 缓存上限并制定回滚方案。
遵循此顺序有助于区分权重适配失败、缓存压力、分布式通信故障以及工具格式错误等状况。此外,该流程还能确保宣传中所称的最大上下文长度具备实际可验证性。

通过 Tokios 对外公开主节点信息。

Tokios 需要 1 一个稳定的、兼容 OpenAI 协议的上游模型端点。在集群环境中,该端点应设置在 主节点 上,而非所有工作节点。
1

务必确保主节点上的模型服务器处于私密状态。

请确认模型服务能在主节点的本地回环 /v1 端点上正常响应,例如 http://127.0.0.1:8000/v1。同时,集群内各工作节点间的通信也应通过集群网络进行。
2

在主节点上配置 1 连接器。

进入 Tokios dashboard 界面后,打开 Setup 并选择 Start pairing。随后在主节点上安装并运行 tokios-connector。该连接器仅负责向外发起连接,无需开放入站端口。
3

配置主节点对应的上游模型信息。

将连接器的 BaseUrl 参数设为主节点本地的 /v1 端点。完整的配置格式可参考 连接器配置说明
4

注册对外可用的部署实例。

Models 中注册一个部署实例,例如 deepseek-v4-flash。将其与主节点服务器所提供的上游模型 ID 进行关联。客户端调用时仅需提供该部署名称,无需使用 Hugging Face 的模型 ID。
5

创建限定权限的 API 密钥。

Create an sk-tok-… key in Keys, optionally scoped to deepseek-v4-flash. Clients then call https://api.tokios.com/v1.
验证通过 — Tokios API 请求测试。 此步骤旨在确认本地集群运行正常后,Tokios 确实能通过兼容 OpenAI 协议的端点正常响应请求。
该命令并不会验证特定的 DeepSeek 集群是否运行正常;请先执行本地检查。

DeepSeek 系列模型概览

对比 V4 Flash、R1 distills 以及 V3 系列模型。

vLLM 远程访问方法

务必将 vLLM /v1 端点设为私密状态,并通过 Tokios 进行访问。

DGX Spark 平台

借助连接器完成 DGX Spark 平台的设置与使用。

RTX 工作站

挑选并配置一台基于 RTX 芯片的本地推理设备。