deepseek-ai/DeepSeek-V4-Flash-0731 をデプロイすることも可能だ。これは V4 Flash プレビュー版に取って代わる公式リリースである。必要な要件は単に総メモリ量だけで決まるわけではない。284B ターゲットモデルは各トークン処理時に 13B ものパラメータを利用する。同梱されている DSpark ドラフトヘッドにより、チェックポイント全体のパラメータ数はおよそ 304B にまで増加する。公開されているサービングフォーマットにおいても、KVキャッシュや一時バッファー、オペレーティングシステム分を除いて約 162~167 GBの重みデータが必要となる。下記の 3 設定例がその要件を満たせる。ただしこれらはソフトウェア面での成熟度が同一ではない。
実用的な推奨事項は簡単だ。まずは 32K~128Kトークン のコンテキストで安定した生成やツール呼び出しが可能か確認し、その後キャッシュ容量を測定する。384Kと1Mは別々のエンジニアリング目標として扱うべきだ。モデル自体は1Mトークン分のコンテキストウィンドウを備えると謳っているが、すべてのローカル構成で1Mトークン分のキャッシュを確保できるわけではない
どの構成が適しているか、またどの程度信頼できるか
検証済みとは、該当するソフトウェアまたはモデルのドキュメントに正確な手順が記載されていることを意味します。コミュニティ検証が必要とは、実行環境や関連する手順は記載されているものの、この特定のチェックポイントとハードウェアの組み合わせが公に再現されていないことを指します。コミュニティでテスト済みとは、一般ユーザーがその方法を報告しているものの、ご自身の環境で再現する必要があることを意味します。実験的とは、アップストリームプロジェクト自体がその手順が本番環境向けではないと警告していることを示します。
まずはメモリ計算から始めましょう
The official model card describes the 284B target model, 13B active parameters per token, and the attached DSpark speculative-decoding module. SGLang’s current hardware matrix counts about 304B parameters for the complete 0731 checkpoint. The active count helps explain compute cost. It does not tell you how much model state must be resident:2台のRTX PRO 6000 Blackwell
NVIDIA lists the RTX PRO 6000 Blackwell with 96 GB of GDDR7 memory and 1,792 GB/s memory bandwidth per card in its product specifications. Two cards give 192 GB of VRAM, enough to hold the published weight formats in principle. SGLang documents tensor parallelism of 2 for the earlier Flash checkpoint in its DeepSeek V4 guide. Its 0731 validation list covers larger 4–8 GPU configurations, not this exact 2-GPU setup. Call this path Community validation required, not verified.推奨される手順
- 選択したランタイム上で両方のGPUが認識されていることを確認する
- まずは32Kというコンテキスト制限下で、一度に1件のリクエストを処理するようにする
- VRAMの使用量や最初のトークン生成までの遅延時間、処理の安定性を測定した上で、徐々に128Kまで値を引き上げていくこと
- If you need 384K or 1M, size the KV cache from measured usage instead of subtracting weights from total VRAM by hand.
2台のDGX Spark
Each DGX Spark has 128 GB of LPDDR5x unified memory and 273 GB/s memory bandwidth. NVIDIA documents a ConnectX-7 clustering path for 2 systems in its Spark stacking guide, and lists the hardware details in its DGX Spark overview. This gives 256 GB of aggregate memory, which is meaningfully less tight than 192 GB for weight plus cache capacity. これは依然としてネットワーク接続型の分散ランタイムです。NVIDIAが公開しているのはクラスタ構成に関する情報であり、公式な0731DeepSeek手順ではありません。2 Sparkに関するコミュニティ報告は以前のFlashチェックポイントを対象としています。0731へ移行した後はモデル読み込み、生成処理、ツール呼び出し、継続的なリクエストの検証を改めて行ってください。推奨される構成
/v1エンドポイントを指すように設定する必要があります。
コミュニティで検証済み — デュアルSpark用の出発パターン。 まずNVIDIAの2 Sparkネットワーク設定を完了させ、次にご使用のバージョンに対応した分散ランタイム手順を適用し、32Kコンテキストから実行を開始してください。プレビュー用チェックポイントコマンドを公式な0731手順として扱わないようご注意ください。
NVIDIAではこの高速接続をConnectX-7クラスタリンクと呼んでいますが、これは単一カード上のNVLink型メモリプールの代替にはなりません。ランタイムは依然として処理を分割しノード間で通信を行います。プロンプトのサイズに応じたスループットやレイテンシを実測してください。
2台のStrix Halo
AMD lists the Ryzen AI Max+ 395 with up to 128 GB of unified memory in its processor specifications. Two fully provisioned systems have enough aggregate capacity for the 162 GB GGUF weight release. 問題の根源は分散型サービングレイヤーにあります。利用可能なルートは llama.cpp RPCです。そのアップストリームRPCのREADMEでは、このRPCが実証実験用の仕組みであると説明されており、不安定かつ安全性に欠けると警告されています。このため本機能は実験的な機能デモに過ぎず、本番環境向けのアーキテクチャとは言えません。 実験的 — llama.cpp RPCの仕様 このRPCワーカーは信頼できるプライベートネットワーク上でのみ実行してください。使用するバイナリ名やフラグはllama.cppのバージョンごとに異なるため、ご自身のバージョンに合ったコマンドはアップストリームのREADMEを参照してください。比較用の公式ベンチマークデータ
ハードウェアの規模が小さくても同等のサポートが得られると判断するのではなく、ベンダーやランタイムの実例を参考にして期待値を設定してください。
検証済み — 現在の 0731版vLLMの基準です。 公式のモデルカードでは 4× GB300、エキスパート並列処理、FP8形式のKVキャッシュ、そして同梱のDSparkモジュールが用いられています。
temperature = 1.0および top_p = 0.95の利用を推奨します。これらのサンプリング設定はサーバー起動時のフラグとは別に管理し、ご自身のエージェント環境で検証してください。
以下の順序で検証を行ってください。
- 該当するチェックポイントをダウンロードし、そのリビジョン情報を記録します。
- Load it with 32K context and 1 concurrent request.
- ワークロードでツールが必要な場合は、短いチャットリクエスト、長文プロンプト、ツール呼び出しリクエストも送信します。
- メモリ消費量、最初のトークン生成までの遅延時間、生成速度、エラー情報を記録します。
- コンテキスト長を 128Kまで増やし、同じワークロードを再度実行します。
- その後で初めて、KVキャッシュの使用制限やロールバック計画を設定した上で 384Kまたは 1Mの検証を行ってください。
Tokiosを通じてヘッドノードを外部に公開します。
Tokiosでは、1という安定したOpenAI互換のアップストリームモデルエンドポイントが必要です。クラスター環境では、これはヘッドノードであり、すべてのワーカーではありません。1
ヘッドノード上のモデルサーバーは非公開にしておくこと
ヘッドノードのループバック用
/v1エンドポイント(例えばhttp://127.0.0.1:8000/v1など)に対してサービングプロセスが応答するか確認してください。ワーカー間の通信はクラスター内ネットワーク上で行うこと。2
ヘッドノード上で1コネクターをペアリングする
In the Tokios dashboard, open Setup and select Start pairing. Install and run
tokios-connector on the head node. The connector dials out; it does not require an inbound port.3
ヘッドノードのアップストリーム設定を行う
コネクターの
BaseUrlをヘッドノードのローカルな/v1エンドポイントに設定してください。完全な設定形式については コネクター設定 をご参照ください。4
パブリックなデプロイを登録する
In Models, register a deployment such as
deepseek-v4-flash. Map it to the upstream model id your head-node server exposes. Clients send the deployment name, not the Hugging Face id.5
スコープ付きのAPIキーを作成する
Create an
sk-tok-… key in Keys, optionally scoped to deepseek-v4-flash. Clients then call https://api.tokios.com/v1.DeepSeekファミリーの概要
V4 FlashとR1 distills、そしてV3シリーズを比較してみましょう。
vLLMのリモートアクセス方法
vLLM
/v1エンドポイントは非公開に保ち、Tokios経由でアクセスするようにしてください。DGX Sparkについて
コネクターを利用してDGX Sparkをセットアップし、使用する手順を説明します。
RTXワークステーションの活用
RTXベースのローカル推論マシンを選定し、設定する方法を解説します。