deepseek-ai/DeepSeek-V4-Flash-0731,这是正式版发布内容,取代了原先的 V4 Flash 预览版。实际可行性并不仅仅取决于内存总量。该 284B 目标模型在生成每个令牌时需调用 13B 个参数。其配套的 DSpark 草稿生成模块更使完整模型参数总量升至约 304B 个。即便如此,在预留 KV 缓存、临时缓冲区及操作系统所需空间后,所需模型权重存储量仍约为 162 至 167 GB。下文所列 3 种配置均可满足这一最低要求,不过其软件环境成熟度各异。
实际操作建议十分简单:先设定 32K 至 128K 个上下文长度进行测试,确认生成过程与工具调用均稳定无误后再测算缓存容量。请将 384K 与 1M 视作两个独立的工程指标。该模型标称支持 1M 个令牌的上下文窗口,但这并不代表所有本地配置都能预留出同等容量的 1M 令牌缓存空间。
哪些配置切实可行?用户又该抱有多大的信心呢?
已验证意味着相关软件或模型文档中明确记载了对应的路径。需社区验证则表示相关运行环境及路径虽有记录,但该特定检查点与硬件组合尚未经公开验证。社区测试通过意味着已有用户成功实践过该方法,不过你仍需在自己的环境中复现。实验性则指上游项目本身已提示该方案尚不适合投入生产使用。
首先进行内存需求计算。
The official model card describes the 284B target model, 13B active parameters per token, and the attached DSpark speculative-decoding module. SGLang’s current hardware matrix counts about 304B parameters for the complete 0731 checkpoint. The active count helps explain compute cost. It does not tell you how much model state must be resident:2 块 RTX PRO 6000 Blackwell 显卡
NVIDIA lists the RTX PRO 6000 Blackwell with 96 GB of GDDR7 memory and 1,792 GB/s memory bandwidth per card in its product specifications. Two cards give 192 GB of VRAM, enough to hold the published weight formats in principle. SGLang documents tensor parallelism of 2 for the earlier Flash checkpoint in its DeepSeek V4 guide. Its 0731 validation list covers larger 4–8 GPU configurations, not this exact 2-GPU setup. Call this path Community validation required, not verified.推荐操作步骤
- 确认所选运行时环境能够识别两块显卡。
- 初始阶段建议将上下文长度设为 32K,每次仅处理 1 个请求。
- 在充分统计显存占用情况、首字生成延迟及运行稳定性后,再逐步将数值提升至 128K 水平。
- 若您需要 384K 或 1M,建议依据实际使用量来设定 KV 缓存大小,而无需手动从总显存容量中扣除权重所占空间。
2 台 DGX Spark 设备
Each DGX Spark has 128 GB of LPDDR5x unified memory and 273 GB/s memory bandwidth. NVIDIA documents a ConnectX-7 clustering path for 2 systems in its Spark stacking guide, and lists the hardware details in its DGX Spark overview. This gives 256 GB of aggregate memory, which is meaningfully less tight than 192 GB for weight plus cache capacity. 该架构本质上仍属基于网络的分布式运行环境。NVIDIA 仅提供了集群互联相关说明,并未发布官方版的 0731 DeepSeek 部署方案。目前社区针对 2 Sparks 系统的测试均基于早期 Flash 版本检查点展开。迁移至 0731 版本后,请务必重新验证模型加载、推理生成、工具调用及持续请求处理能力。推荐的硬件拓扑结构
/v1 接口,而不可直接连接至工作节点或集群互联网络。
经社区验证——双 Spark 系统初始配置范例。 首先请完成 NVIDIA 指定的 2-Spark 集群网络配置流程。随后选用明确适配您当前版本环境的分布式运行方案,并从 32K 上下文长度设置开始部署。切勿将预览版检查点命令视作官方发布的 0731 部署方案。
NVIDIA 将此类高速互联方式称为 ConnectX-7 集群链路。需特别说明的是,该链路无法替代单卡环境下的 NVLink 式内存共享机制:运行时系统仍须将任务拆分并在各节点间传递数据。建议依据实际提示词长度来测试系统吞吐量及延迟表现。
2 台 Strix Halo 设备
AMD lists the Ryzen AI Max+ 395 with up to 128 GB of unified memory in its processor specifications. Two fully provisioned systems have enough aggregate capacity for the 162 GB GGUF weight release. 问题在于分布式服务层。目前可用的方案是 llama.cpp RPC。其 上游 RPC 说明文档 指出该方案仅属概念验证性质,并警示其稳定性较差且安全性不足。因此这仅能视作一个 实验性 的能力演示,绝非可投入生产的架构。 实验性质 — llama.cpp RPC 架构。 仅应在受信任的私有网络内运行 RPC 工作进程。由于不同版本的 llama.cpp 对应的二进制文件名与启动参数各异,请务必参照上游文档以获取适配您所用版本的命令指令。可供参考的官方基准数据
请参考各厂商提供的运行实例来设定预期值,切勿据此认定硬件配置较低的设备也能获得同等程度的支持。
验证通过 — 当前 0731 版本的 vLLM 参考标准。 官方模型说明文档中提及需使用容量为 4× GB300 的设备,同时需启用专家并行机制、FP8 格式的 KV 缓存以及随附的 DSpark 模块。
temperature = 1.0 与 top_p = 0.95 配置。请务必将相关采样参数与服务器启动参数区分开来,并通过智能体测试工具验证其效果。
请按如下顺序执行验证流程
- 下载对应的检查点文件并记录其版本信息。
- 在设定为 32K 的上下文长度及 1 并发请求量的条件下加载该检查点。
- 发送简短对话请求、长文本输入请求,若工作负载涉及工具调用,还需发送工具调用请求。
- 记录内存占用情况、首个令牌生成延迟、生成速率以及任何错误信息。
- 将上下文长度提升至 128K 后再重复执行上述工作负载测试。
- 完成上述步骤后方可测试 384K 或 1M 配置,同时需设定 KV 缓存上限并制定回滚方案。
通过 Tokios 对外公开主节点信息。
Tokios 需要 1 一个稳定的、兼容 OpenAI 协议的上游模型端点。在集群环境中,该端点应设置在 主节点 上,而非所有工作节点。1
务必确保主节点上的模型服务器处于私密状态。
请确认模型服务能在主节点的本地回环
/v1 端点上正常响应,例如 http://127.0.0.1:8000/v1。同时,集群内各工作节点间的通信也应通过集群网络进行。2
在主节点上配置 1 连接器。
进入 Tokios dashboard 界面后,打开 Setup 并选择 Start pairing。随后在主节点上安装并运行
tokios-connector。该连接器仅负责向外发起连接,无需开放入站端口。3
配置主节点对应的上游模型信息。
将连接器的
BaseUrl 参数设为主节点本地的 /v1 端点。完整的配置格式可参考 连接器配置说明。4
注册对外可用的部署实例。
在 Models 中注册一个部署实例,例如
deepseek-v4-flash。将其与主节点服务器所提供的上游模型 ID 进行关联。客户端调用时仅需提供该部署名称,无需使用 Hugging Face 的模型 ID。5
创建限定权限的 API 密钥。
Create an
sk-tok-… key in Keys, optionally scoped to deepseek-v4-flash. Clients then call https://api.tokios.com/v1.DeepSeek 系列模型概览
对比 V4 Flash、R1 distills 以及 V3 系列模型。
vLLM 远程访问方法
务必将 vLLM
/v1 端点设为私密状态,并通过 Tokios 进行访问。DGX Spark 平台
借助连接器完成 DGX Spark 平台的设置与使用。
RTX 工作站
挑选并配置一台基于 RTX 芯片的本地推理设备。