
In diesem Artikel (4)
DeepSeek V4 Flash 0731 Analyse: 50 Punkte, 60 % günstiger
Kernaussagen
- Vergleichen Sie Modelle nach den gesamten Aufgabenkosten, nicht nur nach dem Benchmark-Wert, insbesondere bei wiederholten Workloads mit langem Kontext.
- Testen Sie Cache-Trefferquoten mit Ihren eigenen Prompts, da DeepSeeks Preisvorteil stark von der Cache-Ökonomie abhängt.
- Achten Sie auf vollständige Gewichte und unabhängige Latenzdaten, bevor Sie Produktions-Workloads fest einplanen.
Artificial Analysis sagt, dass DeepSeek 10 Punkte im Intelligence Index gewonnen hat und gleichzeitig die Kosten einer vergleichbaren Luna-Aufgabe durch aggressive Cache-Preise unterboten hat.
Artificial Analysis berichtet, dass DeepSeek 10 Punkte im Intelligence Index hinzugewonnen hat und dabei die Kosten einer vergleichbaren Luna-Aufgabe durch aggressive Cache-Preise unterbot.
Das Lustigste an KI-Benchmarks ist, dass die Zahl, von der alle Screenshots machen, oft nicht die Zahl ist, die später auf deiner Cloud-Rechnung auftaucht. DeepSeek V4 Flash 0731 hat uns gerade beide Zahlen geliefert, was für Hype-Händler rücksichtslos, aber für Leute, die Dinge mit Absicht deployen, nützlich ist. Artificial Analysis berichtet, dass das Modell auf seinem Intelligence Index 50 Punkte erreicht, ein Sprung um 10 Punkte gegenüber dem DeepSeek V4 Flash vom April 2026, während die Cost per Task der First-Party-API von DeepSeek etwa 60% niedriger ausfallen als bei GPT-5.6 Luna. Irgendwo räuspert sich gerade eine Tabellenkalkulation.
Artificial Analysis sieht Flash 0731 nahe bei Luna
Artificial Analysis sagt, dass DeepSeek V4 Flash 0731 auf seinem Intelligence Index 50 Punkte erreicht, gegenüber 40 Punkten beim vorherigen DeepSeek V4 Flash, der im April 2026 veröffentlicht wurde. Damit liegt es laut demselben Bericht von Artificial Analysis auch 6 Punkte vor DeepSeek V4 Pro.
Das Interessante ist nicht nur der Sprung, denn Benchmarks sind Konfetti, solange sie nicht mit der Realität des Deployments verbunden sind. Sondern dass Artificial Analysis das Modell nur einen Intelligence-Index-Punkt hinter GPT-5.6 Luna mit 51 einordnet, nah genug, dass Beschaffungsteams anfangen könnten, sich wie Waschbären in einem Preis-Müllcontainer zu benehmen.
Artificial Analysis vergleicht das Modell außerdem mit nahegelegenen Wettbewerbern: GLM-5.2 mit 51, Gemini 3.6 Flash mit 50, Muse Spark 1.1 mit 51 und Kimi K3 mit 57 als Grenze der Open-Weights-Modelle. Dieser Kontext ist wichtig, denn ein Score von 50 gewinnt nicht den ganzen Gewichtheber-Wettkampf, steht aber plötzlich auf derselben Plattform wie Modelle, die viele Builder für ernsthafte Agent-, Coding- und Reasoning-Workloads in Betracht ziehen würden.
Der Bericht sagt, dass DeepSeek V4 Flash 0731 ein Kontextfenster von 1M Token beibehält und dass seine Größe gegenüber DeepSeek V4 Flash unverändert bleibt. In einfachem Deutsch: Das wirkt weniger wie ein riesiges neues Wesen und eher wie dasselbe Wesen nach einem sehr produktiven Wochenende mit Post-Training.
Die Preisgeschichte ist eigentlich eine Cache-Geschichte
Artificial Analysis sagt, dass DeepSeek V4 Flash 0731 dieselbe Architektur und Preisgestaltung wie der frühere DeepSeek V4 Flash hat, während es auf seiner Pareto-Frontier für Intelligence versus Cost per Task landet. Derselbe Bericht sagt, dass die Cost per Task von DeepSeek V4 Flash 0731 auf DeepSeeks First-Party-API selbst nach OpenAIs Preissenkung von 80% für GPT-5.6 Luna etwa 60% niedriger ist als bei GPT-5.6 Luna.
Das ist die Art Satz, die Benchmark-Diagramme weniger wie Sportgerede und mehr wie eine Rechnung mit Meinungen wirken lässt. Wenn zwei Modelle in einer Aufgaben-Suite ungefähr vergleichbar sind, muss das günstigere nicht jedes Balkendiagramm gewinnen, um einen Deployment-Platz zu gewinnen.
Die geheime Zutat ist laut Artificial Analysis DeepSeeks Cache-Hit-Rabatt von ungefähr 98% auf seiner First-Party-API, verglichen mit dem 90%-Cache-Hit-Rabatt, den der Großteil der Branche anbietet. Hier hört KI-Preisgestaltung auf, einfache Speisekarten-Mathematik zu sein, und wird zu Coupon-Stacking in einem Supermarkt, der von linearer Algebra betrieben wird.
Gecachte Eingaben können für Apps mit wiederholten Prompts, Systemanweisungen, Retrieval-Gerüsten, Wiederverwendung langer Kontexte oder Agent-Loops, die immer denselben Token-Rucksack mitschleppen, sehr wichtig sein. Die Provider-Daten von Artificial Analysis listen DeepSeek als verfügbaren Provider für DeepSeek V4 Flash 0731 auf und zeigen einen gemischten Preis von 0,06 US-Dollar pro 1M Token, wobei vermerkt wird, dass Provider-Benchmarks wie Ausgabegeschwindigkeit und End-to-End-Antwortzeit für diese Seite nicht verfügbar sind.
DeepSeek sagt, der API-Weg bleibt langweilig, was gut ist
Das API-Änderungsprotokoll von DeepSeek sagt, dass die offizielle DeepSeek-V4-Flash-API am 2026-07-31 in die öffentliche Beta gegangen ist und dass die Aufrufmethode unverändert bleibt: Setze den Modellnamen auf deepseek-v4-flash, um die neueste Version zu verwenden. Langweilige Kompatibilität wird unterschätzt. Alle wollen Zauberei, bis ihre Orchestrierungsschicht anfängt zu schreien, weil ein Anbieter das Zauberbuch umbenannt hat.
Dasselbe DeepSeek-Änderungsprotokoll meldet Agent-Benchmark-Ergebnisse für die offizielle Veröffentlichung, darunter Terminal Bench 2.1 mit 82,7, NL2Repo mit 54,2, Cybergym mit 76,7, DeepSWE mit 54,4, Toolathlon verified mit 70,3, Agent Last Exam mit 25,2, Automation Bench Public mit 25,1, DSBench-FullStack mit 68,7 und DSBench-Hard mit 59,6.
DeepSeek sagt, dass das offizielle V4-Flash das Responses-API-Format nativ unterstützt und speziell für Codex angepasst ist. Außerdem sagt DeepSeek, dass DeepSeek-V4-Flash-0731 dieselbe Modellarchitektur und Größe wie DeepSeek-V4-Flash-Preview beibehält und nur erneut post-trainiert wurde.
Dieser letzte Nebensatz ist das echte Nerd-Bonbon: Nicht jede sinnvolle Modellverbesserung erfordert, das Ding größer, heißer und teurer zu machen, wie ein GPU-Rack, das als Pizzaofen cosplayt.
Was Builder als Nächstes testen sollten
Artificial Analysis sagt, dass DeepSeek voraussichtlich in den kommenden Wochen die vollständigen Gewichte des Modells veröffentlichen wird, sodass lokale und selbst gehostete Bewertungen relevanter werden könnten, falls das passiert. Bis dahin ist der praktische Schritt, deinen eigenen Workload sowohl gegen Qualität als auch gegen Cache-Verhalten zu testen.
Ein Modell, das in einem allgemeinen Rechner günstig aussieht, kann teuer werden, wenn deine Prompts alles einmalige Schneeflocken sind, und ein teureres Modell kann erträglich werden, wenn seine Qualität Wiederholungsversuche verhindert. Token-Caching ist hier keine Garnitur, es ist die Soße, der Teller und möglicherweise der Kellner.
Für Builder ist DeepSeek V4 Flash 0731 eine Erinnerung daran, dass es beim Wettbewerb der Frontier-Modelle zunehmend um die gesamten Aufgabenkosten geht, nicht nur darum, wer den höchsten Benchmark stemmen kann. Beobachte Latenzdaten, echte Coding- und Agent-Leistung, Cache-Hit-Raten und ob die erwartete Veröffentlichung der Gewichte die Deployment-Optionen verändert.
Die Anzeigetafel ist enger geworden, aber die Rechnung ist der Ort, an dem die Handlung coden gelernt hat.