
Dans cet article (4)
Analyse de DeepSeek V4 Flash 0731 : score de 50, 60 % moins cher
Points clés
- Comparez les modèles selon le coût total par tâche, et pas seulement selon le score de référence, en particulier pour les charges de travail répétées à long contexte.
- Testez les taux de réussite du cache sur vos propres prompts, car l’avantage tarifaire de DeepSeek dépend fortement de l’économie du cache.
- Surveillez la disponibilité des poids complets et de données de latence indépendantes avant d’engager des charges de travail de production.
Artificial Analysis indique que DeepSeek a gagné 10 points à l’indice d’intelligence tout en réduisant le coût d’une tâche Luna comparable grâce à une tarification agressive du cache.
Artificial Analysis indique que DeepSeek a gagné 10 points à l’Indice d’intelligence tout en proposant un coût inférieur pour une tâche Luna comparable grâce à une tarification agressive du cache.
Ce qu’il y a de plus drôle avec les benchmarks d’IA, c’est que le nombre que tout le monde capture en écran n’est souvent pas celui qui apparaît sur votre facture cloud. DeepSeek V4 Flash 0731 vient de nous donner les deux nombres, ce qui est contrariant pour les marchands de battage médiatique, mais utile pour les personnes qui déploient des choses avec intention. Artificial Analysis rapporte que le modèle obtient 50 sur son Intelligence Index, un bond de 10 points par rapport au DeepSeek V4 Flash d’avril 2026, tandis que le Cost per Task de l’API officielle de DeepSeek est environ 60 % inférieur à celui de GPT-5.6 Luna. Quelque part, un tableur vient de se racler la gorge.
Artificial Analysis place Flash 0731 près de Luna
Artificial Analysis indique que DeepSeek V4 Flash 0731 obtient 50 sur son Intelligence Index, contre 40 pour le précédent DeepSeek V4 Flash publié en avril 2026. Cela le place aussi 6 points devant DeepSeek V4 Pro, selon le même rapport d’Artificial Analysis. Le point intéressant n’est pas seulement le bond, car les benchmarks sont des confettis s’ils ne sont pas liés à la réalité du déploiement. C’est qu’Artificial Analysis place le modèle à un point d’Intelligence Index derrière GPT-5.6 Luna, à 51, assez près pour que les équipes achats commencent à se comporter comme des ratons laveurs dans une benne à prix. Artificial Analysis situe aussi le modèle face à des concurrents proches : GLM-5.2 à 51, Gemini 3.6 Flash à 50, Muse Spark 1.1 à 51, et Kimi K3 à 57 comme frontière des poids ouverts. Ce contexte compte, car un score de 50 ne signifie pas gagner tout le concours d’haltérophilie, mais il signifie soudain se tenir sur la même plateforme que des modèles que beaucoup de créateurs envisageraient pour des charges de travail sérieuses d’agents, de codage et de raisonnement. Le rapport indique que DeepSeek V4 Flash 0731 conserve une fenêtre de contexte de 1M de tokens, et que sa taille reste inchangée par rapport à DeepSeek V4 Flash. En clair : cela ressemble moins à une nouvelle créature géante qu’à la même créature après un week-end très productif de post-entraînement.
L’histoire du prix est surtout une histoire de cache Artificial Analysis indique
que DeepSeek V4 Flash 0731 partage une architecture et une tarification identiques avec le précédent DeepSeek V4 Flash, tout en arrivant sur sa frontière de Pareto pour l’intelligence par rapport au Cost per Task. Le même rapport indique que, même après la baisse de prix de 80 % d’OpenAI sur GPT-5.6 Luna, le Cost per Task de DeepSeek V4 Flash 0731 sur l’API officielle de DeepSeek est environ 60 % inférieur à celui de GPT-5.6 Luna. C’est le genre de phrase qui fait que les graphiques de benchmarks ressemblent moins à des discussions sportives et davantage à une facture qui a des opinions. Si deux modèles sont à peu près comparables sur une suite de tâches, le moins cher n’a pas besoin de gagner tous les histogrammes pour gagner une place en déploiement. L’ingrédient secret, selon Artificial Analysis, est la remise d’environ 98 % de DeepSeek sur les hits de cache dans son API officielle, contre la remise de 90 % sur les hits de cache proposée par la plupart du secteur. C’est là que la tarification de l’IA cesse d’être un simple calcul de menu et devient une accumulation de coupons dans une épicerie tenue par l’algèbre linéaire. Les entrées mises en cache peuvent beaucoup compter pour les applications avec des prompts répétés, des instructions système, des échafaudages de récupération, une réutilisation de longs contextes, ou des boucles d’agents qui traînent toujours le même sac à dos de tokens. Les données fournisseurs d’Artificial Analysis listent DeepSeek comme fournisseur disponible pour DeepSeek V4 Flash 0731 et affichent un prix mixte de 0,06 $ par 1M de tokens, tout en notant que les benchmarks fournisseurs comme la vitesse de sortie et le temps de réponse de bout en bout ne sont pas disponibles pour cette page.
DeepSeek dit que le chemin
API reste ennuyeux, et c’est une bonne chose Le journal des modifications de l’API de DeepSeek indique que l’API officielle DeepSeek-V4-Flash est entrée en bêta publique le 2026-07-31, et que la méthode d’appel reste inchangée : définissez le nom du modèle sur deepseek-v4-flash pour utiliser la dernière version. La compatibilité ennuyeuse est sous-estimée. Tout le monde veut de la sorcellerie jusqu’à ce que sa couche d’orchestration se mette à hurler parce qu’un fournisseur a renommé le grimoire. Le même journal des modifications de DeepSeek rapporte des résultats de benchmarks d’agents pour la version officielle, notamment Terminal Bench 2.1 à 82,7, NL2Repo à 54,2, Cybergym à 76,7, DeepSWE à 54,4, Toolathlon verified à 70,3, Agent Last Exam à 25,2, Automation Bench Public à 25,1, DSBench-FullStack à 68,7, et DSBench-Hard à 59,6. DeepSeek affirme que le V4-Flash officiel prend nativement en charge le format Responses API et qu’il est spécifiquement adapté à Codex. Il indique aussi que DeepSeek-V4-Flash-0731 conserve la même architecture et la même taille de modèle que DeepSeek-V4-Flash-Preview, et qu’il a seulement été post-entraîné à nouveau. Cette dernière proposition est le vrai bonbon pour nerds : toutes les améliorations significatives de modèle n’exigent pas de rendre la chose plus grande, plus chaude et plus coûteuse, comme un rack de GPU qui se déguise en four à pizza.
Ce que les créateurs devraient tester ensuite Artificial Analysis indique
que DeepSeek devrait publier les poids complets du modèle dans les prochaines semaines, donc les évaluations locales et auto-hébergées pourraient devenir plus pertinentes si cela se produit. D’ici là, la démarche pratique consiste à tester votre propre charge de travail à la fois sur la qualité et sur le comportement du cache. Un modèle qui paraît bon marché dans une calculatrice générique peut devenir coûteux si vos prompts sont tous des flocons de neige uniques, et un modèle plus cher peut devenir acceptable si sa qualité évite les nouvelles tentatives. La mise en cache des tokens n’est pas une garniture ici, c’est la sauce, l’assiette, et peut-être même le serveur. Pour les créateurs, DeepSeek V4 Flash 0731 rappelle que la concurrence entre modèles de frontière porte de plus en plus sur le coût total par tâche, pas seulement sur qui peut soulever au développé-couché le benchmark le plus haut. Surveillez les données de latence, les performances réelles en codage et en agents, les taux de hits de cache, et vérifiez si la publication attendue des poids change les options de déploiement. Le tableau des scores s’est resserré, mais c’est sur la facture que l’intrigue a appris à coder.