
इस लेख में (4)
DeepSeek V4 Flash 0731 विश्लेषण: 50 स्कोर, 60% सस्ता
मुख्य बातें
- मॉडलों की तुलना केवल बेंचमार्क स्कोर से नहीं, बल्कि कुल कार्य लागत से करें, खासकर बार-बार किए जाने वाले लंबे-कॉन्टेक्स्ट वर्कलोड के लिए।
- अपने ही प्रॉम्प्ट्स पर कैश हिट दरों का परीक्षण करें, क्योंकि DeepSeek की कीमत में बढ़त काफी हद तक कैश अर्थशास्त्र पर निर्भर करती है।
- प्रोडक्शन वर्कलोड प्रतिबद्ध करने से पहले पूर्ण वेट्स और स्वतंत्र लेटेंसी डेटा पर नज़र रखें।
आर्टिफिशियल एनालिसिस के अनुसार, डीपसीक ने 10 इंटेलिजेंस इंडेक्स अंक हासिल किए, साथ ही आक्रामक कैश प्राइसिंग के ज़रिए तुलनीय Luna कार्य लागत को भी कम कर दिया।
Artificial Analysis का कहना है कि DeepSeek ने 10 Intelligence Index अंक हासिल किए, जबकि आक्रामक कैश मूल्य निर्धारण के जरिए उसने एक तुलनीय Luna कार्य लागत को भी कम कर दिया।
AI बेंचमार्क्स की सबसे मजेदार बात यह है कि जिस नंबर का स्क्रीनशॉट हर कोई शेयर करता है, वह अक्सर वह नंबर नहीं होता जो आपके क्लाउड बिल पर दिखाई देता है। DeepSeek V4 Flash 0731 ने अभी हमें दोनों नंबर दे दिए हैं, जो हाइप बेचने वालों के लिए तो असुविधाजनक है, लेकिन उन लोगों के लिए उपयोगी है जो चीज़ों को सोच-समझकर डिप्लॉय करते हैं। Artificial Analysis की रिपोर्ट है कि यह मॉडल अपने Intelligence Index पर 50 स्कोर करता है, जो अप्रैल 2026 वाले DeepSeek V4 Flash से 10 पॉइंट की छलांग है, जबकि DeepSeek के फर्स्ट-पार्टी API पर Cost per Task, GPT-5.6 Luna से लगभग 60% कम आता है। कहीं न कहीं, एक स्प्रेडशीट ने अभी गला खंखारा है।
Artificial Analysis ने Flash 0731 को Luna के करीब रखा है
Artificial Analysis का कहना है कि DeepSeek V4 Flash 0731 उसके Intelligence Index पर 50 स्कोर करता है, जो अप्रैल 2026 में रिलीज़ हुए पिछले DeepSeek V4 Flash के 40 से ऊपर है। उसी Artificial Analysis रिपोर्ट के अनुसार, यह इसे DeepSeek V4 Pro से भी 6 पॉइंट आगे रखता है। दिलचस्प बात सिर्फ छलांग नहीं है, क्योंकि बेंचमार्क तब तक कंफेटी जैसे हैं जब तक उन्हें डिप्लॉयमेंट की वास्तविकता से न जोड़ा जाए। बात यह है कि Artificial Analysis इस मॉडल को GPT-5.6 Luna से सिर्फ एक Intelligence Index पॉइंट पीछे रखता है, जिसका स्कोर 51 है—इतना करीब कि प्रोक्योरमेंट टीमें कीमतों के डंपस्टर में रैकून जैसी हरकतें शुरू कर सकती हैं। Artificial Analysis मॉडल को आसपास के प्रतिस्पर्धियों के संदर्भ में भी रखता है: GLM-5.2 51 पर, Gemini 3.6 Flash 50 पर, Muse Spark 1.1 51 पर, और Kimi K3 57 पर, जिसे ओपन वेट्स फ्रंटियर बताया गया है। यह संदर्भ मायने रखता है, क्योंकि 50 का स्कोर पूरी वेटलिफ्टिंग प्रतियोगिता जीतना नहीं है, लेकिन यह अचानक उन मॉडलों के साथ उसी प्लेटफ़ॉर्म पर खड़ा है जिन्हें कई बिल्डर गंभीर एजेंट, कोडिंग और रीजनिंग वर्कलोड के लिए विचार करेंगे। रिपोर्ट कहती है कि DeepSeek V4 Flash 0731 में 1M टोकन कॉन्टेक्स्ट विंडो बनी रहती है, और इसका आकार DeepSeek V4 Flash से अपरिवर्तित है। सरल भाषा में: यह किसी विशाल नए जीव जैसा कम और उसी जीव जैसा ज्यादा दिखता है जिसने पोस्ट-ट्रेनिंग के साथ बहुत उत्पादक सप्ताहांत बिताया हो।
कीमत की कहानी असल में कैश
की कहानी है Artificial Analysis कहता है कि DeepSeek V4 Flash 0731, पहले वाले DeepSeek V4 Flash जैसी ही आर्किटेक्चर और प्राइसिंग साझा करता है, जबकि Intelligence बनाम Cost per Task के लिए उसके Pareto frontier पर जगह बनाता है। वही रिपोर्ट कहती है कि OpenAI द्वारा GPT-5.6 Luna पर 80% कीमत कटौती के बाद भी, DeepSeek के फर्स्ट-पार्टी API पर DeepSeek V4 Flash 0731 का Cost per Task, GPT-5.6 Luna से लगभग 60% कम है। यह ऐसा वाक्य है जो बेंचमार्क चार्ट्स को स्पोर्ट्स टॉक कम और राय रखने वाले इनवॉइस जैसा ज्यादा बना देता है। अगर दो मॉडल किसी टास्क सूट पर मोटे तौर पर तुलनीय हैं, तो सस्ते मॉडल को डिप्लॉयमेंट स्लॉट जीतने के लिए हर बार चार्ट जीतने की ज़रूरत नहीं होती। Artificial Analysis के अनुसार, गुप्त सामग्री DeepSeek के फर्स्ट-पार्टी API पर लगभग 98% कैश हिट डिस्काउंट है, जबकि उद्योग के अधिकांश हिस्से द्वारा दिया जाने वाला कैश हिट डिस्काउंट 90% है। यहीं पर AI प्राइसिंग सरल मेन्यू गणित रहना बंद कर देती है और लीनियर अलजेब्रा द्वारा चलाए जा रहे किराना स्टोर में कूपन स्टैकिंग बन जाती है। दोहराए जाने वाले प्रॉम्प्ट्स, सिस्टम निर्देशों, रिट्रीवल स्कैफोल्डिंग, लंबे कॉन्टेक्स्ट के पुन: उपयोग, या एजेंट लूप्स वाले ऐप्स के लिए कैश्ड इनपुट बहुत मायने रख सकता है, जो बार-बार टोकन का वही बैकपैक ढोते रहते हैं। Artificial Analysis प्रदाता डेटा DeepSeek को DeepSeek V4 Flash 0731 के लिए उपलब्ध प्रदाता के रूप में सूचीबद्ध करता है और प्रति 1M टोकन $0.06 ब्लेंडेड प्राइस दिखाता है, साथ ही यह नोट करता है कि आउटपुट स्पीड और एंड-टू-एंड रिस्पॉन्स टाइम जैसे प्रदाता बेंचमार्क उस पेज के लिए उपलब्ध नहीं हैं।
DeepSeek कहता है कि
API रास्ता उबाऊ बना रहता है, जो अच्छी बात है DeepSeek के API चेंज लॉग के अनुसार आधिकारिक DeepSeek-V4-Flash API ने 2026-07-31 को पब्लिक बीटा में प्रवेश किया, और कॉलिंग मेथड अपरिवर्तित रहता है: नवीनतम संस्करण का उपयोग करने के लिए मॉडल नाम को deepseek-v4-flash पर सेट करें। उबाऊ कम्पैटिबिलिटी को कम आंका जाता है। हर कोई जादू चाहता है, जब तक कि उनका ऑर्केस्ट्रेशन लेयर चीखना शुरू न कर दे क्योंकि किसी वेंडर ने स्पेलबुक का नाम बदल दिया। वही DeepSeek चेंज लॉग आधिकारिक रिलीज़ के लिए एजेंट बेंचमार्क परिणाम रिपोर्ट करता है, जिनमें Terminal Bench 2.1 पर 82.7, NL2Repo पर 54.2, Cybergym पर 76.7, DeepSWE पर 54.4, Toolathlon verified पर 70.3, Agent Last Exam पर 25.2, Automation Bench Public पर 25.1, DSBench-FullStack पर 68.7, और DSBench-Hard पर 59.6 शामिल हैं। DeepSeek कहता है कि आधिकारिक V4-Flash मूल रूप से Responses API फॉर्मेट को सपोर्ट करता है और विशेष रूप से Codex के लिए अनुकूलित है। यह भी कहता है कि DeepSeek-V4-Flash-0731, DeepSeek-V4-Flash-Preview जैसी ही मॉडल आर्किटेक्चर और आकार बनाए रखता है, और केवल दोबारा पोस्ट-ट्रेन किया गया था। यही आखिरी बात असली नर्ड कैंडी है: हर महत्वपूर्ण मॉडल सुधार के लिए चीज़ को बड़ा, ज्यादा गर्म और ज्यादा महंगा बनाना ज़रूरी नहीं होता, जैसे कोई GPU रैक पिज़्ज़ा ओवन का कॉसप्ले कर रहा हो।
बिल्डरों को आगे क्या टेस्ट करना चाहिए Artificial Analysis कहता है कि DeepSeek
आने वाले हफ्तों में मॉडल के पूरे वेट्स रिलीज़ करने की उम्मीद है, इसलिए अगर ऐसा होता है तो लोकल और सेल्फ-होस्टेड मूल्यांकन अधिक प्रासंगिक हो सकते हैं। तब तक, व्यावहारिक कदम यह है कि अपने वर्कलोड को गुणवत्ता और कैश व्यवहार, दोनों के खिलाफ टेस्ट करें। कोई मॉडल जो सामान्य कैलकुलेटर में सस्ता दिखता है, महंगा बन सकता है अगर आपके सभी प्रॉम्प्ट्स एक-बार इस्तेमाल होने वाले स्नोफ्लेक्स हैं, और कोई महंगा मॉडल भी सहनीय बन सकता है अगर उसकी गुणवत्ता रीट्राईज़ रोक देती है। यहाँ टोकन कैशिंग सिर्फ सजावट नहीं है, यह सॉस है, प्लेट है, और शायद वेटर भी है। बिल्डरों के लिए, DeepSeek V4 Flash 0731 यह याद दिलाता है कि फ्रंटियर-मॉडल प्रतिस्पर्धा अब तेजी से कुल टास्क लागत के बारे में है, सिर्फ इस बारे में नहीं कि कौन सबसे ऊँचा बेंचमार्क बेंच-प्रेस कर सकता है। लेटेंसी डेटा, वास्तविक कोडिंग और एजेंट प्रदर्शन, कैश हिट रेट्स, और यह देखें कि अपेक्षित वेट्स रिलीज़ डिप्लॉयमेंट विकल्पों को बदलती है या नहीं। स्कोरबोर्ड और कड़ा हो गया, लेकिन इनवॉइस वह जगह है जहाँ कहानी ने कोड करना सीखा।