Skip to main content
If you want DeepSeek’s latest open-weight model, start with deepseek-ai/DeepSeek-V4-Flash-0731. It supersedes the V4 Flash preview, adds substantially stronger agentic behavior, supports low, high, and max reasoning effort, and bundles the DSpark speculative-decoding module. It is a 284B-target, 13B-active MoE that can fit across 2 high-memory systems, but it still needs careful runtime and memory planning. Recourrez à un R1 distill lorsque vous avez besoin d’un raisonnement similaire à celui de DeepSeek sur un ordinateur portable ou avec une GPU grand public 1. Les modèles R1 et V3 complets restent des options destinées aux configurations multi-GPU de classe 671B. Pour consulter la comparaison matérielle complète 0731 ainsi que les différentes méthodes de mise en service, rendez-vous sur DeepSeek V4 Flash 0731 matériel local.

La gamme de modèles DeepSeek

The active-parameter count affects compute per generated token. It does not reduce the memory required to keep all experts resident. That is why a 13B-active V4 Flash still needs roughly 162–167 GB for its weights before cache and runtime overhead.

Quel modèle DeepSeek devriez-vous exécuter ?

  • Vous disposez d’un ordinateur portable ou d’une GPU grand public 1 : Commencez par un R1 distill. deepseek-r1:14b constitue un point de départ idéal pour Ollama sur une GPU de 24 Go. Consultez DeepSeek-R1.
  • Si vous avez besoin du modèle de raisonnement R1 original : prévoyez l’acquisition d’un serveur multi-GPU. Le modèle complet 671b ne peut pas être exécuté sur un seul poste de travail.
  • Si vous recherchez un modèle de base DeepSeek polyvalent : la gamme V3 reste adaptée aux configurations multi-GPU de classe 671B. Utilisez les étiquettes V3.1 dans Ollama selon votre plan de déploiement ; vérifiez les étiquettes disponibles avant de retenir une option.
  • Si vous souhaitez utiliser la version actuelle V4 Flash : optez pour deepseek-ai/DeepSeek-V4-Flash-0731. L’auto-hébergement est envisageable, mais la capacité matérielle seule ne suffit pas. Choisissez la solution la plus adaptée en fonction de la maturité des outils d’exécution dans le guide matériel local.

DeepSeek-V4-Flash-0731

DeepSeek a publié DeepSeek-V4-Flash-0731 le 31 juillet 2026. Le fiche technique du modèle officielle le désigne comme la version V4 Flash officielle succédant à la version préliminaire. Ce modèle cible 284B, fonctionne en mode mélange d’experts avec un niveau d’activité de 13B, inclut un connecteur DSpark intégré, et gère un contexte de 1M tokens, ainsi que des efforts de raisonnement de niveaux low, high et max, plus l’appel d’outils. SGLang indique un total d’environ 304B paramètres lorsque le connecteur de brouillon est pris en compte. Les poids sont distribués sous licence MIT.

Pourquoi la version 0731 est-elle la plus pertinente ?

DeepSeek’s own agentic evaluation shows a large step up from the preview. The model card reports 82.7 on Terminal Bench 2.1, 54.4 on DeepSWE, and 70.3 on Toolathlon-Verified. Those results used DeepSeek Harness in minimal mode, max reasoning effort, temperature = 1.0, and top_p = 0.95. Treat them as evidence for the exact evaluated setup, not guaranteed local throughput or quality.
Il ne faut pas déployer le dépôt préliminaire deepseek-ai/DeepSeek-V4-Flash si l’on souhaite évaluer la version actuelle. Il est conseillé de verrouiller la version deepseek-ai/DeepSeek-V4-Flash-0731 et de noter son identifiant de révision.
Le dépôt 0731 ne fournit pas de modèle de chat Jinja. Il propose toutefois un paquet dédié encoding permettant de convertir les messages conformes au format OpenAI en entrées pour le modèle et de décoder les réponses générées. Il est nécessaire d’utiliser un environnement d’exécution compatible avec ce format, puis de tester les échanges multi-tours, le contenu de raisonnement ainsi que les appels à des connecteurs avant de procéder au déploiement.
Veillez à utiliser ces identifiants de manière appropriée :
Un déploiement Tokios correspond à un nom public que vous attribuez. Il diffère de l’ID de modèle amont. En enregistrant deepseek-v4-flash, les clients transmettront ce nom dans le champ model tandis que votre environnement d’exécution utilisera deepseek-ai/DeepSeek-V4-Flash-0731.

Dans quelle mesure Flash se rapproche-t-il de GPT-5.6 ?

Treat comparisons as configuration-specific, not a general parity claim. Artificial Analysis reports Flash Max at 50 and GPT-5.6 Sol Low at 49 in its named comparison. That result compares Flash Max with Sol at its Low effort setting. It does not establish parity with GPT-5.6 Sol at higher effort, or across every workload.

Chemins locaux pour V4 Flash

Chaque chemin de déploiement requiert de l’espace disque pour le checkpoint, de la marge pour les téléchargements temporaires et les allocations en temps d’exécution, ainsi qu’une réserve suffisante pour le cache KV. Commencez avec un contexte de 32K à 128K. Considérez 384K et 1M comme des cibles d’ajustement distinctes, et non comme des paramètres par défaut.
Si vous utilisez déjà V4 Flash, conservez le point de terminaison de service sur l’interface loopback du nœud principal. Exécutez le connecteur Tokios 1 sur ce même nœud, en le configurant uniquement pour pointer vers le point de terminaison /v1 du moteur d’exécution. Le guide matériel décrit la topologie et le déploiement correspondant.

Les tailles de quantification déterminent le nombre de machines nécessaires.

Unsloth propose des versions GGUF sur unsloth/DeepSeek-V4-Flash-0731-GGUF. Ces tailles revêtent une importance particulière, car elles indiquent si une seule machine suffit ou non.

Un DGX Spark peut-il exécuter DeepSeek-V4-Flash-0731 ?

Oui, en version 3 bits sur une seule unité. Le guide d’Unsloth recommande précisément UD-IQ3_XXS car il convient à un système doté de 128 Go de mémoire. Il mentionne également sur le forum des développeurs NVIDIA que ce modèle fonctionne sur un seul Spark grâce à llama-server, y compris dans des contextes utilisant des versions 262K à plus faible taille en 2 bits. Ce qu’un seul Spark ne peut pas contenir, ce sont les versions quasi sans perte : la version UD-Q4_K_XL de 155 Go et celle de UD-Q8_K_XL de 162 Go dépassent toutes deux la limite de 128 Go. Elles nécessitent donc deux Sparks ainsi que la mémoire combinée indiquée dans le tableau ci-dessus.

Le processeur Strix Halo peut-il exécuter DeepSeek-V4-Flash-0731 ?

Oui, sous la même condition de 3 bits. Un système Strix Halo doté de 128 Go de mémoire supporte la version de 103 Go ; toutefois, les versions quasi sans perte exigent un second appareil. Cette approche distribuée s’appuie sur le protocole RPC de llama.cpp, présenté par ses créateurs comme un simple prototype. Ici, le débit est limité par la bande passante mémoire et non par la capacité totale. Le nombre d’13B paramètres actifs joue en votre faveur : le calcul par jeton reste modeste même si l’ensemble des 284B paramètres doivent rester en mémoire.

Une carte graphique de 24 Go peut-elle exécuter DeepSeek-V4-Flash-0731 ?

Non. La plus petite version publiée occupe déjà 92 Go, donc aucune carte grand public ne suffit, quelle que soit la quantification appliquée. Transférer autant de données vers la RAM système annule les gains de vitesse offerts par Flash. Privilégiez plutôt un modèle distillé DeepSeek-R1, conçu pour fonctionner sur une seule carte graphique.

The R1 and V3 family

La version V4 Flash ne remplace pas l’ensemble des modèles DeepSeek antérieurs. Les versions distillées R1 restent idéales pour du matériel peu puissant. Les gammes complètes R1 et V3 demeurent pertinentes si vous disposez déjà d’un cluster de déploiement de classe 671B. Consultez DeepSeek-R1 pour connaître les tailles de modèles disponibles, le contexte d’utilisation et les conseils de configuration. Consultez également quel modèle convient à votre GPU ? afin de comprendre le calcul de la mémoire requise pour les modèles plus volumineux.

Connectez un déploiement DeepSeek à Tokios

Une fois que le runtime sélectionné fonctionne correctement, installez le connecteur sur la même machine que le point de terminaison du runtime. Le connecteur communique avec Tokios en sortie ; il ne propose aucun port d’entrée.
  1. Associez le connecteur depuis l’onglet Setup dans Tokios dashboard.
  2. Enregistrez un déploiement dans Models. Par exemple, enregistrez deepseek-v4-flash et liez-le à l’ID de modèle amont fourni par votre serveur.
  3. Créez une clé API sk-tok-… à portée limitée dans Keys.
  4. Appelez https://api.tokios.com/v1 en indiquant le nom de votre déploiement dans model.
Pour un cluster V4 Flash, exécutez le connecteur uniquement sur le nœud principal, là où il peut accéder au point de terminaison /v1 compatible OpenAI du cluster. Suivez le guide matériel local pour les exemples de déploiement, puis enregistrez un déploiement.

Questions fréquentes

Il faut entre environ 110 Go et 169 Go, selon la version choisie. La version en 3 bits, nommée UD-IQ3_XXS, occupe 103 Go sur le disque et requiert entre 110 et 135 Go de mémoire, ce qui lui permet de fonctionner sur une seule machine dotée de 128 Go de mémoire unifiée. La version UD-Q4_K_XL quasi sans perte pèse 155 Go, tandis que la version sans perte UD-Q8_K_XL pèse 162 Go ; toutes deux nécessitent plusieurs machines de ce type. Tous les paramètres 284B restent en mémoire, quelle que soit la quantité de modèles 13B actifs.
Les poids du modèle sont sous licence MIT, ce qui constitue une autorisation exceptionnellement large pour un modèle d’une telle puissance, autorisant même son utilisation commerciale. Toutefois, pouvoir l’utiliser gratuitement ne signifie pas qu’il soit possible de l’exécuter sans frais : même la version la plus légère requiert 92 Go de mémoire, ce qui fait de la puissance matérielle le véritable coût à supporter. DeepSeek propose également une API hébergée payante si vous préférez ne pas procéder à un déploiement autonome.
Ce n’est pas conforme à la procédure officielle. Le guide d’Unsloth indique d’utiliser les fichiers GGUF séparés pour charger le checkpoint 0731 via llama.cpp ; par ailleurs, la version actuelle de llama.cpp prend en charge l’architecture V4. Il convient donc de consulter la bibliothèque d’Ollama pour vérifier la disponibilité du modèle, plutôt que de supposer qu’un tag local existe. Les modèles R1 Distill et DeepSeek-V3.1 disposent quant à eux de tags Ollama — voir DeepSeek-R1.
Scale and purpose. V4 Flash is the current 284B mixture-of-experts release with a 1M-token context, aimed at agentic and coding work on 128 GB machines and up. The R1 distills are small dense models that fit a single consumer GPU and trade capability for reach. If your hardware is one 24 GB card, the distill is not a compromise — it is the only one of the two that runs.
Il faut d’abord lancer le modèle en local, puis installer le connecteur Tokios sur l’ordinateur hébergeant le modèle — dans le cas d’un cluster, uniquement sur le nœud principal. Ce connecteur établit les communications vers l’extérieur, de sorte que la machine dotée des GPU n’a pas besoin d’ouvrir de port d’entrée. Les clients peuvent ensuite appeler https://api.tokios.com/v1 en indiquant une clé sk-tok-… ainsi que le nom de votre déploiement dans le champ model.

Matériel requis pour exécuter V4 Flash en local

Compare 2 RTX PRO 6000s, 2 DGX Sparks, and 2 Strix Halo systems.

DeepSeek-R1

Choisissez et exécutez un modèle R1 Distill adapté à un matériel de faible capacité.

Sélectionnez un modèle en fonction de la tâche à accomplir

Comparez les modèles locaux en ce qui concerne le raisonnement, le codage et les tâches d’agent.

Associez un modèle à votre GPU.

Comprenez les exigences en matière de mémoire liées aux poids, au cache et à la quantification.