Skip to main content
DeepSeekの最新オープンウェイトモデルを利用したい場合はまず deepseek-ai/DeepSeek-V4-Flash-0731 から始めてください。このモデルはV4 Flashプレビュー版を置き換える形となり、はるかに優れたエージェント挙動を実現し、lowhighmaxといった推論負荷設定にも対応しています。さらにDSparkという投機的デコードモジュールも同梱されています。これは 284B をターゲットとし、13B で稼働するMoE構造を持つモデルで、2 以上の大容量メモリを備えたシステムでも動作可能ですが、実行時やメモリ管理には細心の注意が必要です。 Use an R1 distill instead when you need DeepSeek-style reasoning on a laptop or 1 consumer GPU. The full R1 and V3 models remain 671B-class, multi-GPU options. For the complete 0731 hardware comparison and serving paths, see DeepSeek V4 Flash 0731 local hardware.

DeepSeek製品群の一覧

アクティブパラメータ数は生成される各トークンの計算量に影響するが、すべてのエキスパートをメモリ上に保持するための容量は減少しない。そのため 13Bアクティブ設定の V4 Flashでも、キャッシュや実行時オーバーヘッドを除けば重みデータ用に約 162~167ギガバイトが必要となる

どのDeepSeekモデルを利用すべきか?

  • ノートパソコンや 1向け消費者向けGPUをお持ちの場合: まずは R1 distill版から試してみよう。deepseek-r1:14bは 24ギガバイトのGPUでOllamaを利用する際の実用的な選択肢だ。DeepSeek-R1 も参照してほしい
  • 本来の R1推論モデルが必要な場合: 複数GPUを搭載した本格的なサーバーを用意する必要がある。フルサイズの 671bモデルは単体のワークステーションでは運用できない
  • 汎用的なDeepSeekベースモデルが必要な場合: V3シリーズは依然として 671Bクラスかつ複数GPU向けだ。デプロイ計画に合わせてOllamaでV3.1タグを活用し、標準化する前に最新のタグ情報を確認してほしい
  • You need the current V4 Flash model: Use deepseek-ai/DeepSeek-V4-Flash-0731. It is possible to self-host, but hardware capacity alone is not enough. Choose a path by runtime maturity in the local hardware guide.

DeepSeek-V4-Flash-0731

DeepSeek released DeepSeek-V4-Flash-0731 on July 31, 2026. The official model card identifies it as the official V4 Flash release that supersedes the preview. It describes a 284B-target-model, 13B-active mixture-of-experts model with a bundled DSpark head, 1M-token context, low, high, and max reasoning effort, and tool calling. SGLang reports about 304B parameters when it counts the attached draft head. The weights are MIT-licensed.

なぜ 0731が今回の主要なリリース版なのか

DeepSeek自身によるエージェント型評価では、プレビュー版から大幅な向上が確認されている。モデルカードによると、82.7はTerminal Bench 2.1で、54.4はDeepSWEで、70.3はToolathlon-Verifiedで得られた数値だ。これらの結果は、最小限の設定でDeepSeek Harnessを使用し、max推論負荷、temperature = 1.0、およびtop_p = 0.95という条件の下で得られたものである。これらは厳密な評価環境における実績値として捉えるべきであり、ローカル環境でのスループットや品質が必ずしも同様になるとは限らない。
現在のリリース版を評価したい場合は、プレビュー版のリポジトリ deepseek-ai/DeepSeek-V4-Flashをデプロイしてはならない。deepseek-ai/DeepSeek-V4-Flash-0731を固定し、そのリビジョンを記録しておくこと。
The 0731 repository does not ship a Jinja chat template. It includes a dedicated encoding package for turning OpenAI-compatible messages into model input and parsing completions. Use a runtime recipe that supports this encoding, then test multi-turn chat, reasoning content, and tool calls before exposing the deployment.
以下の識別子を意図的に利用すること:
Tokiosにおけるデプロイとは公開用の名称であり、アップストリームモデルIDとは別物である。deepseek-v4-flashを登録すればクライアントは modelフィールドにその名前を送信し、ランタイム側では deepseek-ai/DeepSeek-V4-Flash-0731が提供される仕組みとなる。

FlashはGPT-5.6とどの程度近い性能を持つか?

Treat comparisons as configuration-specific, not a general parity claim. Artificial Analysis reports Flash Max at 50 and GPT-5.6 Sol Low at 49 in its named comparison. That result compares Flash Max with Sol at its Low effort setting. It does not establish parity with GPT-5.6 Sol at higher effort, or across every workload.

V4 Flash用のローカルパス

各パスにおいてチェックポイント用のディスク容量、一時ダウンロード用の領域、実行時の割り当て用スペース、そしてKVキャッシュ用の余裕容量が必要となります。初期設定としては 32Kから128Kトークン分のコンテキストを想定してください。また 384Kおよび1Mは既定値ではなく、個別に調整すべきパラメータとして扱う必要があります。
すでにV4 Flashを運用中の場合、サービングエンドポイントはヘッドノード上のループバックインターフェースに維持してください。そのヘッドノード上で1用のTokiosコネクターを実行し、実行環境の/v1エンドポイントのみを指すように設定します。ハードウェアガイドにトポロジーやデプロイ構成の詳細が記載されています。

量子化サイズの設定次第で必要となるマシン台数が決まります。

Unsloth社は unsloth/DeepSeek-V4-Flash-0731-GGUFにてGGUF形式のビルドファイルを公開しています。このサイズの値が非常に重要であり、単一のマシンで十分かどうかを判断する基準となります。

DGX SparkではDeepSeek-V4-Flash-0731を実行可能か?

はい、3ビットで、単一のユニット上で実行可能です。Unslothのガイドでは、UD-IQ3_XXSが選ばれているのは128ギガバイトのマシンに適しているからであり、NVIDIAの開発者フォーラムの報告によれば、llama-serverを通じて単一のSpark上で実行されています。さらに262Kの文脈では、より小さな2ビット版も利用されているとのことです。 一つのSparkでは収容できないのは、ほぼロスレスなビルドです。UD-Q4_K_XL用のサイズは155ギガバイト、UD-Q8_K_XL用は162ギガバイトであり、どちらも128ギガバイトを超えています。こうしたビルドを扱うには二つのSparkと、上記の表に記載されているプールされたメモリが必要となります。

Strix HaloでDeepSeek-V4-Flash-0731を動かせるか?

はい、3ビット条件は同じです。128ギガバイト容量のStrix Haloなら103ギガバイト版モデルも収容可能です。ただしほぼロスレスな版を利用する場合は別のマシンが必要で、その分散処理経路はllama.cpp RPCを利用しますが、開発者側でもこれはあくまで実証実験段階の仕組みと説明されています。 ここでのスループットは容量ではなくメモリ帯域幅に制限されます。実際に使用されるパラメータ数が13B個という点は有利に働きます。全284B個のパラメータが常にメモリ上に存在する必要があるものの、トークンごとの計算負荷は小さく抑えられます。

Can a 24 GB GPU run DeepSeek-V4-Flash-0731?

いいえ。公開されている最小サイズのビルドでも 92 GBにもなります。そのためどのような量子化レベルでも一般向けのグラフィックカードでは対応できず、大量の重みデータをシステムRAMにオフロードすればFlashを利用する際の高速性も失われてしまいます。代わりに DeepSeek-R1の蒸留版 をご利用ください。これらは単一のGPUで動作するよう設計されています。

R1およびV3シリーズ

V4 Flash does not replace every earlier DeepSeek option. The R1 distills remain the practical choice for small hardware. The full R1 and V3 line remain useful when you already operate a 671B-class serving cluster. ディストillationのサイズやコンテキスト長、セットアップに関するアドバイスは DeepSeek-R1 をご覧ください。より大規模なモデルにおけるメモリ消費量の計算方法については どのサイズのモデルがご自身のGPUに適しているか を参照してください。

TokiosとDeepSeekのデプロイを接続する

選択したランタイムが正常に稼働するようになったら、そのエンドポイントと同じマシン上にコネクターをインストールします。このコネクターはTokiosへ接続するだけで、受信用のポートは開放しません。
  1. Pair the connector from the Setup tab in the Tokios dashboard.
  2. Register a deployment in Models. For example, register deepseek-v4-flash and map it to the upstream model id your server exposes.
  3. Create a scoped sk-tok-… API key in Keys.
  4. Call https://api.tokios.com/v1 with your deployment name in model.
V4 Flashクラスターの場合、クラスターのOpenAI互換 /v1 エンドポイントにアクセス可能なヘッドノード上のみでコネクターを実行します。ローカルハードウェアガイド に従ってサービング例を試した後、 デプロイを登録 してください。

よくある質問

使用するビルドによって異なりますが、およそ 110 GBから 169 GB程度です。3ビット版の UD-IQ3_XXS はディスク上で 103 GBのサイズとなり、 110 GBから 135 GBのメモリを必要とします。そのため単体の 128 GB統合メモリ搭載マシンでも動作可能です。ほぼロスレスな UD-Q4_K_XL は 155 GB、ロスレス版の UD-Q8_K_XL は 162 GBとなり、どちらも複数の同様なマシンが必要です。どのビルドでも 284B パラメータは常にメモリ上に保持され、アクティブなデプロイ数 13B に左右されません。
このモデルの重みはMITライセンス下で公開されており、これほど高性能なモデルとしては極めて寛容な条件です。商業利用も許可されています。無料で利用できることと、実際に無料で実行できることは別物です。最小構成でも 92 GBものメモリを要するため、実際のコストはハードウェアにかかるのです。自前でホスティングしたくない場合は、DeepSeekが提供する有料のホスティング型APIも利用可能です。
公式ドキュメントに記載されている手順では不可能です。Unslothのガイドでは、分割されたGGUFファイルを使いllama.cpp経由で 0731チェックポイントを処理しますが、標準版のllama.cppにはV4アーキテクチャ向けのサポートが含まれています。ローカル用タグが存在すると決めつけるのではなく、Ollamaのライブラリで現在利用可能なモデルを確認してください。R1 distillsおよびDeepSeek-V3.1にはOllama用タグが存在します。詳細は DeepSeek-R1 をご覧ください。
Scale and purpose. V4 Flash is the current 284B mixture-of-experts release with a 1M-token context, aimed at agentic and coding work on 128 GB machines and up. The R1 distills are small dense models that fit a single consumer GPU and trade capability for reach. If your hardware is one 24 GB card, the distill is not a compromise — it is the only one of the two that runs.
Serve it locally, then pair the Tokios connector on the machine holding the runtime — for a cluster, on the head node only. The connector dials outward, so the box with the GPUs never needs an inbound port. Clients then call https://api.tokios.com/v1 with an sk-tok-… key and your deployment name in the model field.

V4 Flashを動作させるためのローカルハードウェア要件

Compare 2 RTX PRO 6000s, 2 DGX Sparks, and 2 Strix Halo systems.

DeepSeek-R1

より小規模なハードウェアでも利用可能なR1推論用distillsモデルを選んで実行する方法

用途に応じて適切なモデルを選択する方法

推論やコーディング、エージェント作業向けのローカルモデルを比較してみましょう。

ご使用のGPUに最適なモデルを選定してください。

モデルの重みデータやキャッシュ、量子化処理に必要なメモリ要件を把握しておきましょう。