deepseek-ai/DeepSeek-V4-Flash-0731 から始めてください。このモデルはV4 Flashプレビュー版を置き換える形となり、はるかに優れたエージェント挙動を実現し、lowやhigh、maxといった推論負荷設定にも対応しています。さらにDSparkという投機的デコードモジュールも同梱されています。これは 284B をターゲットとし、13B で稼働するMoE構造を持つモデルで、2 以上の大容量メモリを備えたシステムでも動作可能ですが、実行時やメモリ管理には細心の注意が必要です。
Use an R1 distill instead when you need DeepSeek-style reasoning on a laptop or 1 consumer GPU. The full R1 and V3 models remain 671B-class, multi-GPU options. For the complete 0731 hardware comparison and serving paths, see DeepSeek V4 Flash 0731 local hardware.
DeepSeek製品群の一覧
アクティブパラメータ数は生成される各トークンの計算量に影響するが、すべてのエキスパートをメモリ上に保持するための容量は減少しない。そのため 13Bアクティブ設定の V4 Flashでも、キャッシュや実行時オーバーヘッドを除けば重みデータ用に約 162~167ギガバイトが必要となる
どのDeepSeekモデルを利用すべきか?
- ノートパソコンや 1向け消費者向けGPUをお持ちの場合: まずは R1 distill版から試してみよう。
deepseek-r1:14bは 24ギガバイトのGPUでOllamaを利用する際の実用的な選択肢だ。DeepSeek-R1 も参照してほしい - 本来の R1推論モデルが必要な場合: 複数GPUを搭載した本格的なサーバーを用意する必要がある。フルサイズの
671bモデルは単体のワークステーションでは運用できない - 汎用的なDeepSeekベースモデルが必要な場合: V3シリーズは依然として 671Bクラスかつ複数GPU向けだ。デプロイ計画に合わせてOllamaでV3.1タグを活用し、標準化する前に最新のタグ情報を確認してほしい
- You need the current V4 Flash model: Use
deepseek-ai/DeepSeek-V4-Flash-0731. It is possible to self-host, but hardware capacity alone is not enough. Choose a path by runtime maturity in the local hardware guide.
DeepSeek-V4-Flash-0731
DeepSeek releasedDeepSeek-V4-Flash-0731 on July 31, 2026. The official model card identifies it as the official V4 Flash release that supersedes the preview. It describes a 284B-target-model, 13B-active mixture-of-experts model with a bundled DSpark head, 1M-token context, low, high, and max reasoning effort, and tool calling. SGLang reports about 304B parameters when it counts the attached draft head. The weights are MIT-licensed.
なぜ 0731が今回の主要なリリース版なのか
DeepSeek自身によるエージェント型評価では、プレビュー版から大幅な向上が確認されている。モデルカードによると、82.7はTerminal Bench 2.1で、54.4はDeepSWEで、70.3はToolathlon-Verifiedで得られた数値だ。これらの結果は、最小限の設定でDeepSeek Harnessを使用し、max推論負荷、temperature = 1.0、およびtop_p = 0.95という条件の下で得られたものである。これらは厳密な評価環境における実績値として捉えるべきであり、ローカル環境でのスループットや品質が必ずしも同様になるとは限らない。
The 0731 repository does not ship a Jinja chat template. It includes a dedicated
encoding package for turning OpenAI-compatible messages into model input and parsing completions. Use a runtime recipe that supports this encoding, then test multi-turn chat, reasoning content, and tool calls before exposing the deployment.Tokiosにおけるデプロイとは公開用の名称であり、アップストリームモデルIDとは別物である。
deepseek-v4-flashを登録すればクライアントは modelフィールドにその名前を送信し、ランタイム側では deepseek-ai/DeepSeek-V4-Flash-0731が提供される仕組みとなる。FlashはGPT-5.6とどの程度近い性能を持つか?
Treat comparisons as configuration-specific, not a general parity claim. Artificial Analysis reports Flash Max at 50 and GPT-5.6 Sol Low at 49 in its named comparison. That result compares Flash Max with Sol at its Low effort setting. It does not establish parity with GPT-5.6 Sol at higher effort, or across every workload.V4 Flash用のローカルパス
各パスにおいてチェックポイント用のディスク容量、一時ダウンロード用の領域、実行時の割り当て用スペース、そしてKVキャッシュ用の余裕容量が必要となります。初期設定としては 32Kから128Kトークン分のコンテキストを想定してください。また 384Kおよび1Mは既定値ではなく、個別に調整すべきパラメータとして扱う必要があります。
量子化サイズの設定次第で必要となるマシン台数が決まります。
Unsloth社はunsloth/DeepSeek-V4-Flash-0731-GGUFにてGGUF形式のビルドファイルを公開しています。このサイズの値が非常に重要であり、単一のマシンで十分かどうかを判断する基準となります。
DGX SparkではDeepSeek-V4-Flash-0731を実行可能か?
はい、3ビットで、単一のユニット上で実行可能です。Unslothのガイドでは、UD-IQ3_XXSが選ばれているのは128ギガバイトのマシンに適しているからであり、NVIDIAの開発者フォーラムの報告によれば、llama-serverを通じて単一のSpark上で実行されています。さらに262Kの文脈では、より小さな2ビット版も利用されているとのことです。
一つのSparkでは収容できないのは、ほぼロスレスなビルドです。UD-Q4_K_XL用のサイズは155ギガバイト、UD-Q8_K_XL用は162ギガバイトであり、どちらも128ギガバイトを超えています。こうしたビルドを扱うには二つのSparkと、上記の表に記載されているプールされたメモリが必要となります。
Strix HaloでDeepSeek-V4-Flash-0731を動かせるか?
はい、3ビット条件は同じです。128ギガバイト容量のStrix Haloなら103ギガバイト版モデルも収容可能です。ただしほぼロスレスな版を利用する場合は別のマシンが必要で、その分散処理経路はllama.cpp RPCを利用しますが、開発者側でもこれはあくまで実証実験段階の仕組みと説明されています。 ここでのスループットは容量ではなくメモリ帯域幅に制限されます。実際に使用されるパラメータ数が13B個という点は有利に働きます。全284B個のパラメータが常にメモリ上に存在する必要があるものの、トークンごとの計算負荷は小さく抑えられます。Can a 24 GB GPU run DeepSeek-V4-Flash-0731?
いいえ。公開されている最小サイズのビルドでも 92 GBにもなります。そのためどのような量子化レベルでも一般向けのグラフィックカードでは対応できず、大量の重みデータをシステムRAMにオフロードすればFlashを利用する際の高速性も失われてしまいます。代わりに DeepSeek-R1の蒸留版 をご利用ください。これらは単一のGPUで動作するよう設計されています。R1およびV3シリーズ
V4 Flash does not replace every earlier DeepSeek option. The R1 distills remain the practical choice for small hardware. The full R1 and V3 line remain useful when you already operate a 671B-class serving cluster.
ディストillationのサイズやコンテキスト長、セットアップに関するアドバイスは DeepSeek-R1 をご覧ください。より大規模なモデルにおけるメモリ消費量の計算方法については どのサイズのモデルがご自身のGPUに適しているか を参照してください。
TokiosとDeepSeekのデプロイを接続する
選択したランタイムが正常に稼働するようになったら、そのエンドポイントと同じマシン上にコネクターをインストールします。このコネクターはTokiosへ接続するだけで、受信用のポートは開放しません。- Pair the connector from the Setup tab in the Tokios dashboard.
- Register a deployment in Models. For example, register
deepseek-v4-flashand map it to the upstream model id your server exposes. - Create a scoped
sk-tok-…API key in Keys. - Call
https://api.tokios.com/v1with your deployment name inmodel.
/v1 エンドポイントにアクセス可能なヘッドノード上のみでコネクターを実行します。ローカルハードウェアガイド に従ってサービング例を試した後、 デプロイを登録 してください。
よくある質問
DeepSeek-V4-Flash-0731を利用する際に必要なVRAMの容量はどのくらいですか?
DeepSeek-V4-Flash-0731を利用する際に必要なVRAMの容量はどのくらいですか?
使用するビルドによって異なりますが、およそ 110 GBから 169 GB程度です。3ビット版の
UD-IQ3_XXS はディスク上で 103 GBのサイズとなり、 110 GBから 135 GBのメモリを必要とします。そのため単体の 128 GB統合メモリ搭載マシンでも動作可能です。ほぼロスレスな UD-Q4_K_XL は 155 GB、ロスレス版の UD-Q8_K_XL は 162 GBとなり、どちらも複数の同様なマシンが必要です。どのビルドでも 284B パラメータは常にメモリ上に保持され、アクティブなデプロイ数 13B に左右されません。DeepSeek-V4-Flash-0731は無料で利用できますか?
DeepSeek-V4-Flash-0731は無料で利用できますか?
このモデルの重みはMITライセンス下で公開されており、これほど高性能なモデルとしては極めて寛容な条件です。商業利用も許可されています。無料で利用できることと、実際に無料で実行できることは別物です。最小構成でも 92 GBものメモリを要するため、実際のコストはハードウェアにかかるのです。自前でホスティングしたくない場合は、DeepSeekが提供する有料のホスティング型APIも利用可能です。
Ollamaを使ってDeepSeek V4 Flashを実行することは可能ですか?
Ollamaを使ってDeepSeek V4 Flashを実行することは可能ですか?
公式ドキュメントに記載されている手順では不可能です。Unslothのガイドでは、分割されたGGUFファイルを使いllama.cpp経由で 0731チェックポイントを処理しますが、標準版のllama.cppにはV4アーキテクチャ向けのサポートが含まれています。ローカル用タグが存在すると決めつけるのではなく、Ollamaのライブラリで現在利用可能なモデルを確認してください。R1 distillsおよびDeepSeek-V3.1にはOllama用タグが存在します。詳細は DeepSeek-R1 をご覧ください。
V4 FlashとR1 distillsの違いは何ですか?
V4 FlashとR1 distillsの違いは何ですか?
Scale and purpose. V4 Flash is the current 284B mixture-of-experts release with a 1M-token context, aimed at agentic and coding work on 128 GB machines and up. The R1 distills are small dense models that fit a single consumer GPU and trade capability for reach. If your hardware is one 24 GB card, the distill is not a compromise — it is the only one of the two that runs.
別のマシンからV4 Flashのデプロイ先にアクセスするにはどうすればよいですか?
別のマシンからV4 Flashのデプロイ先にアクセスするにはどうすればよいですか?
Serve it locally, then pair the Tokios connector on the machine holding the runtime — for a cluster, on the head node only. The connector dials outward, so the box with the GPUs never needs an inbound port. Clients then call
https://api.tokios.com/v1 with an sk-tok-… key and your deployment name in the model field.V4 Flashを動作させるためのローカルハードウェア要件
Compare 2 RTX PRO 6000s, 2 DGX Sparks, and 2 Strix Halo systems.
DeepSeek-R1
より小規模なハードウェアでも利用可能なR1推論用distillsモデルを選んで実行する方法
用途に応じて適切なモデルを選択する方法
推論やコーディング、エージェント作業向けのローカルモデルを比較してみましょう。
ご使用のGPUに最適なモデルを選定してください。
モデルの重みデータやキャッシュ、量子化処理に必要なメモリ要件を把握しておきましょう。