Modèles IA 12 min de lecture Intermédiaire

DeepSeek V4 : guide des modèles, prix API et limites

Comparaison de DeepSeek V4 Flash et V4 Pro pour l’API

DeepSeek V4 existe en deux modèles API. V4 Flash vise le débit et le coût, tandis que V4 Pro réserve davantage de capacité aux tâches complexes. Les deux proposent un contexte de 1M de tokens, les modes avec ou sans raisonnement, les appels d’outils et des interfaces compatibles OpenAI ou Anthropic. Au 18 juillet 2026, l’API affiche 0,14$ en entrée hors cache et 0,28$ en sortie pour Flash, contre 0,435$ et 0,87$ pour Pro. Les anciens identifiants deepseek-chat et deepseek-reasoner doivent disparaître le 24 juillet 2026.

DeepSeek V4 Pro et Flash couvrent deux niveaux de charge

DeepSeek a publié V4 Pro et V4 Flash le 24 avril 2026. Pro annonce 1,6T de paramètres au total et 49B actifs. Flash descend à 284B au total et 13B actifs pour réduire le coût et augmenter le débit.

Les deux modèles proposent un contexte de 1M de tokens, une sortie maximale annoncée de 384K tokens, les appels d’outils et le JSON. Ils peuvent fonctionner avec ou sans raisonnement. Le mode FIM, qui complète du code entre un préfixe et un suffixe, reste limité au mode sans raisonnement.

DeepSeek publie les poids et un rapport technique, ce qui ouvre une voie d’hébergement distincte de l’API officielle. Cette possibilité demande toutefois une infrastructure adaptée. Le coût matériel et la complexité d’exploitation peuvent dépasser le prix de l’API pour un usage irrégulier.

Prix officiels de DeepSeek V4

ModèleEntrée en cacheEntrée hors cacheSortie
DeepSeek V4 Flash0,0028$0,14$0,28$
DeepSeek V4 Pro0,003625$0,435$0,87$

Les montants correspondent à 1M de tokens au 18 juillet 2026. Le prix d’entrée en cache paraît presque négligeable, mais une requête bénéficie du cache uniquement si son préfixe correspond aux données déjà traitées. Un contexte unique ou souvent modifié reste facturé au tarif hors cache.

Le coût complet inclut aussi les reprises, les sorties longues, les appels d’outils et la supervision. Une réponse bon marché qui déclenche trois corrections peut coûter plus qu’une réponse plus chère acceptée dès le premier passage.

Migration avant la fin de deepseek-chat et deepseek-reasoner

DeepSeek annonce l’arrêt des identifiants deepseek-chat et deepseek-reasoner le 24 juillet 2026 à 15h59 UTC. Pendant la transition, ils pointent vers les modes sans raisonnement et avec raisonnement de V4 Flash.

La migration utile remplace l’identifiant dans une configuration centrale, puis rejoue les tests de sortie structurée, d’outils et de longueur de contexte. Un remplacement global dans le code multiplie les points de retour en arrière et recrée le verrouillage que l’alias devait éviter.

LLM_MODEL_FAST=deepseek-v4-flash
LLM_MODEL_DEEP=deepseek-v4-pro

Les interfaces OpenAI Chat Completions et Anthropic réduisent le travail d’intégration. Elles ne rendent pas tous les paramètres identiques. Les options de raisonnement, les erreurs, les outils obligatoires et les formats structurés doivent rester couverts par des contrats automatisés.

Ce que montrent les retours terrain

Deux contenus Meydeey documentent DeepSeek V4 sous des angles complémentaires. Le test de lancement de DeepSeek V4 analyse le rapport coût-performance. Le retour après deux mois en production ajoute les limites observées dans une architecture multi-modèles.

Le modèle se défend surtout quand le volume rend le prix déterminant et que le workflow sait reprendre une erreur. Un traitement sensible exige toujours une validation indépendante. Le faible coût ne réduit ni le risque d’une mauvaise sortie ni les obligations liées aux données envoyées.

Choisir Flash, Pro ou une autre famille

Flash convient aux tâches fréquentes, à la préparation de contexte et aux agents qui multiplient les appels. Pro devient pertinent lorsque Flash échoue sur le raisonnement, le code complexe ou la fidélité aux longues consignes.

Une architecture durable conserve au moins un modèle de repli d’une autre famille. Le guide OpenRouter et routage de modèles montre comment distinguer le repli entre fournisseurs et le repli entre modèles. Une passerelle interne peut remplir le même rôle si elle expose des alias, des limites et des journaux cohérents.

Limites testées et points à vérifier

Cette page s’appuie sur un retour terrain publié par Meydeey et sur les sources officielles de l’éditeur.

  • Le prix catalogue ne couvre pas le coût de la passerelle, de l’observabilité ni des reprises sur erreur.
  • La compatibilité de format ne garantit pas que tous les paramètres avancés se comportent comme chez OpenAI ou Anthropic.
  • Les tests vidéo portent sur des workflows précis et doivent être complétés par des évaluations propres au projet.

Sources officielles et méthode

Les informations instables ont été vérifiées le 18 juillet 2026 sur les pages officielles ci-dessous. Les faits publiés par un éditeur sont distingués des observations terrain et des limites qui restent à reproduire.

Consulter la méthode éditoriale et les règles de vérification.

Construire une stack IA qui reste maîtrisable

Le LABO IA t’aide à choisir les modèles, cadrer les coûts et mettre en production des systèmes vérifiables sans dépendre d’un seul fournisseur.

Découvrir le programme

Questions fréquentes

Quelle différence entre DeepSeek V4 Flash et V4 Pro ?

Flash privilégie le débit et le coût, avec 13B de paramètres actifs annoncés. Pro vise les tâches plus exigeantes avec 49B de paramètres actifs. Les deux partagent un contexte de 1M de tokens et les modes avec ou sans raisonnement.

Combien coûte DeepSeek V4 ?

Au 18 juillet 2026, Flash coûte 0,14$ en entrée hors cache et 0,28$ en sortie par million de tokens. Pro coûte 0,435$ en entrée hors cache et 0,87$ en sortie. Le cache réduit fortement le prix d’entrée.

Faut-il remplacer deepseek-chat dans son code ?

Oui. DeepSeek annonce la fin de deepseek-chat et deepseek-reasoner le 24 juillet 2026. Les nouveaux identifiants sont deepseek-v4-flash et deepseek-v4-pro. Une migration doit être testée avant cette échéance.