
Dans cet article (4)
Tarification de DeepSeek V4 Pro : analyse du quadruplement entre heures de pointe et heures creuses
Points clés
- Les budgets d’API de modèles nécessitent un suivi au niveau des jetons, pas des estimations mensuelles approximatives.
- Les tarifs de pointe et hors pointe peuvent orienter la demande sans bloquer les utilisateurs.
- Les succès de cache, les échecs de cache et la longueur de sortie sont désormais des paramètres de conception produit.
Le mouvement V4 Pro montre comment un accès bon marché à l’IA peut évoluer vers une tarification tenant compte des ressources lorsque l’utilisation se heurte à une puissance de calcul limitée.
La décision de V4 Pro montre comment un accès bon marché à l’IA peut évoluer vers une tarification tenant compte des ressources dès que l’utilisation rencontre des capacités de calcul rares.
La tarification bon marché d’une API est une merveilleuse tactique d’acquisition client, jusqu’au moment où la facture commence à sonner comme une alarme incendie. DeepSeek V4 Pro a atteint ce moment un peu gênant de l’âge adulte : l’API n’est plus simplement vendue comme un accès peu coûteux à un modèle performant, elle est tarifée comme une infrastructure partagée aux heures de pointe. La hausse multipliée par quatre fait le gros titre. La séparation entre heures pleines et heures creuses est la leçon produit.
Le lancement est une architecture tarifaire Reuters
a rapporté que DeepSeek avait augmenté les tarifs API de ses modèles V4, et Channel Insider a décrit l’augmentation de l’API V4 comme étant supérieure à un quadruplement. Selon la documentation de l’API DeepSeek, la tarification de V4 Pro est désormais divisée entre tarifs d’heures creuses et d’heures pleines, les heures creuses coûtant la moitié du prix des heures pleines. DeepSeek indique V4 Pro à 0,022 $ pour l’entrée avec cache hit, 0,66 $ pour l’entrée avec cache miss, et 1,98 $ pour la sortie par million de tokens en tarification d’heures creuses, montant à 0,044 $, 1,32 $ et 3,96 $ en tarification d’heures pleines. V4 Flash suit la même structure à 0,007 $, 0,22 $ et 0,66 $ en heures creuses, puis 0,014 $, 0,44 $ et 1,32 $ en heures pleines. La documentation de l’API DeepSeek nomme aussi deux modèles API V4 : deepseek-v4-flash, qui sert DeepSeek-V4-Flash-0731, et deepseek-v4-pro, qui sert DeepSeek-V4-Pro-0813. Les deux utilisent une longueur de contexte de 1 million et une sortie maximale de 384 000, selon la même documentation. La différence intéressante concerne la concurrence : DeepSeek indique une limite de concurrence de 2500 pour V4 Flash et de 500 pour V4 Pro. Voilà la gamme de produits en miniature : une voie pour le débit, une autre pour des capacités plus lourdes. Cet écart de concurrence est l’indice révélateur. Les pages de tarification font généralement semblant d’être des documents comptables, mais les bonnes sont des systèmes de régulation du trafic. Celle-ci indique aux développeurs que la capacité premium n’est pas infinie et que l’entreprise veut déplacer l’usage vers les heures moins chères quand c’est possible.
Pourquoi V4 Pro peut demander plus Artificial Analysis décrit DeepSeek
V4 Pro (Reasoning, Max Effort) comme un modèle à poids ouverts publié en avril 2026. Le modèle a obtenu 45 à l’Artificial Analysis Intelligence Index, contre une médiane de 26 parmi les modèles comparables, et le site indique qu’il prend en charge l’entrée texte, la sortie texte et une fenêtre de contexte de 1 million de tokens. Cela aide à expliquer pourquoi DeepSeek peut tester un plafond tarifaire plus élevé sans abandonner totalement sa posture de challenger. Si le modèle est nettement plus fort, la discussion sur le prix passe du token le moins cher au token utile. Le piège, c’est la verbosité. Artificial Analysis indique que DeepSeek V4 Pro a généré 180 millions de tokens lors de son évaluation Intelligence Index, contre une médiane de 99 millions, et qualifie le modèle de très verbeux. Dans l’économie des API, ce n’est pas une note de bas de page, c’est le compteur qui tourne. Un modèle qui raisonne bien mais parle beaucoup peut transformer des limites de sortie généreuses en mauvaise surprise de coût pour les clients qui ne mesurent pas les prompts, les complétions et les nouvelles tentatives.
L’effet de second ordre est comportemental La documentation
de l’API DeepSeek indique que la facturation est basée sur le nombre total de tokens d’entrée et de sortie, l’entrée étant divisée en catégories cache hit et cache miss. Cette distinction compte davantage dans la nouvelle structure, car le chemin coûteux n’est pas seulement d’utiliser V4 Pro, c’est d’utiliser V4 Pro en heures pleines, avec un cache miss, et de générer de longues réponses. Cette page de tarification est un livre dont vous êtes le héros, où les fins coûteuses commencent par des prompts non mis en cache et des sorties verbeuses. Le bon réflexe pour les bâtisseurs est de traiter la mise en cache et la longueur des réponses comme des exigences produit, pas comme des tâches de nettoyage. La tarification en heures pleines et heures creuses change aussi la conversation avec les clients. Un prix d’API fixe invite les équipes à demander si un modèle est assez bon marché. Un prix basé sur l’heure demande si la charge de travail est assez urgente. Les évaluations par lots, les analyses internes et les tâches non interactives peuvent souvent être déplacées vers des fenêtres moins chères, tandis que les parcours destinés aux utilisateurs peuvent justifier les tarifs d’heures pleines si la latence compte. C’est un modèle plus honnête pour une infrastructure rare que de prétendre que chaque token arrive avec le même profil de coût.
Ce que les bâtisseurs devraient copier, et
ce que les clients devraient surveiller Reuters et Channel Insider présentent le changement comme une hausse de prix, ce qui est vrai, mais la lecture la plus utile est que DeepSeek passe d’une tarification d’adoption à une tarification consciente des ressources. Pour les fondateurs et les responsables produit, la leçon est simple : si les prix bas sont votre angle d’attaque, décidez tôt de ce qui se passe quand l’usage devient réel. Si la réponse est un choc de facture soudain multiplié par quatre, les clients se sentiront pris au piège. Si la réponse est une échelle visible de contrôles liés au cache, au timing et à la sortie, les clients peuvent planifier. Pour les clients, le prochain sprint devrait inclure une observabilité des coûts au niveau des tokens. Suivez les taux de cache hit, les taux de cache miss, la longueur des sorties, l’usage en heures pleines, et les fonctionnalités qui ont réellement besoin de V4 Pro plutôt que de V4 Flash. Le prochain mouvement logique de DeepSeek n’est pas forcément une autre modification de prix. Surveillez si la documentation officielle évolue vers des contrôles budgétaires plus clairs, des conseils de mise en cache et des schémas de planification qui rendent la nouvelle architecture tarifaire plus facile à mettre en œuvre.